Bellman Policy Optimization (BPO) là phương pháp huấn luyện mô hình ngôn ngữ không cần critic, giúp tối ưu hóa khả năng suy luận thông qua các phần thưởng cuối cùng mà không cần ước tính giá trị trạng thái trung gian.
Nghiên cứu giới thiệu bộ dữ liệu AMPLE-Math với hơn 5.000 bài toán, giúp phân tách và đánh giá chính xác đóng góp của thông tin đặc quyền trong quá trình tự chưng cất (OPSD) cho mô hình ngôn ngữ.
TTPO giới thiệu phương pháp tự học không cần nhãn bằng cách sử dụng bình chọn đa số làm nhãn giả và học tăng cường nhóm để tinh chỉnh mô hình. Kỹ thuật này giúp cải thiện đáng kể hiệu suất suy luận toán học của các mô hình nhỏ như Qwen3-1.7B, đạt kết quả ngang ngửa với phương pháp có giám sát.
BPCO là phương pháp huấn luyện mới kết hợp nhiều kỹ thuật tiên tiến nhằm khắc phục sự bất ổn trong Reinforcement Learning dựa trên Critic, giúp cải thiện đáng kể khả năng suy luận toán học của các mô hình ngôn ngữ lớn.