# RL suy luận theo đoạn tiếp theo có thực sự vượt trội hơn SFT? Đánh giá lại chiến lược huấn luyện với dữ liệu không có CoT

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-08-27 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/da95af193ff0fb2d
- Link gốc: https://arxiv.org/abs/2608.23256

## Tóm tắt AI

Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.

## Thân bài

Tác giả: Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Yinhao Tang [xem email] [v1] Thứ Hai, 24 tháng 8 năm 2026 13:47:45 UTC (810 KB)
