# TTPO: Tối ưu hóa chiến lược khi kiểm thử, giúp mô hình ngôn ngữ lớn tự học mà không cần nhãn

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-08-27 07:00 (giờ Việt Nam)
- Điểm AI: 45/100
- Link AIHOT.vn: https://aihot.vn/items/55c5547a8fd9cbe9
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtce310801throi3inbmgpxh
- Link gốc: https://arxiv.org/abs/2608.27448

## Tóm tắt AI

TTPO giới thiệu phương pháp tự học không cần nhãn bằng cách sử dụng bình chọn đa số làm nhãn giả và học tăng cường nhóm để tinh chỉnh mô hình. Kỹ thuật này giúp cải thiện đáng kể hiệu suất suy luận toán học của các mô hình nhỏ như Qwen3-1.7B, đạt kết quả ngang ngửa với phương pháp có giám sát.

## Thân bài

Tác giả: Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Aozhe Wang [xem email] [v1] Thứ Năm, 27 tháng 8 năm 2026 17:58:10 UTC (450 KB)
