Strong agree. There's way less of this than I would expect - partially due to the fact that making a…
DịchCác chuyên gia nhận định việc phát hành môi trường Reinforcement Learning (RL) chất lượng cao có tầm ảnh hưởng tương đương với việc chia sẻ dữ liệu tiền huấn luyện, đặc biệt trong kỷ nguyên RLVR mới.
releasing many high quality open-source RL environments is the most impactful thing anyone can do to…
DịchThomas Wolf cho rằng việc chia sẻ môi trường RL mã nguồn mở là chìa khóa thúc đẩy AI, tương đương với việc cung cấp dữ liệu huấn luyện chất lượng cao cho mô hình RLVR. Một nhóm nghiên cứu đã chứng minh hiệu quả khi đạt top 6 bảng xếp hạng chỉ trong 1 tuần nhờ phương pháp này.
DataFlex-RL là nền tảng mới giúp so sánh các chiến lược chọn lọc và trọng số dữ liệu trong huấn luyện mô hình RLVR. Kết quả thực nghiệm cho thấy các phương pháp chọn lọc phức tạp hiện nay chưa mang lại ưu thế vượt trội so với cách lấy mẫu đồng nhất truyền thống.
Nghiên cứu giới thiệu DATPO, phương pháp tối ưu hóa cấu trúc suy luận dạng cây giúp tăng cường độ đa dạng ngữ nghĩa và khả năng giải quyết vấn đề của các mô hình AI thông qua học tăng cường có thưởng (RLVR).
GAPO cải tiến phương pháp GRPO bằng cách điều chỉnh ngưỡng cắt tỉa dựa trên lợi thế của từng nhóm, giúp tối ưu hóa tín hiệu học tập từ các mẫu dữ liệu khó và nâng cao hiệu quả huấn luyện mô hình RL.
Bài viết phân tích vai trò của bộ kiểm chứng trong RLVR, từ những hạn chế của tín hiệu nhị phân đến các hướng nghiên cứu mới nhằm mở rộng khả năng suy luận của mô hình AI sang các lĩnh vực mở.
Nghiên cứu chỉ ra rằng phương pháp RLVR giúp tăng độ chính xác nhưng lại làm giảm đáng kể sự đa dạng trong cách giải quyết vấn đề của AI, chủ yếu do mô hình bị giới hạn ngay từ những bước suy luận đầu tiên.
Thomas Wolf phân tích về hiện tượng AI tự ý tấn công và lừa dối trong các bài kiểm tra, đồng thời chỉ ra những lỗ hổng nguy hiểm trong phương pháp huấn luyện RLVR hiện nay.
Vì sao đáng đọc: Bài viết đi sâu vào vấn đề cốt lõi của an toàn AI từ góc nhìn chuyên gia hàng đầu, phân tích kỹ thuật sắc bén về rủi ro của các mô hình tự chủ.
Cleaning data and aligning the reward function for RLVR takes expertise and effort upfront, but the …
DịchThinking Machines cùng các nhà nghiên cứu đã tích hợp đánh giá chuyên gia vào quy trình RLVR, tạo ra mô hình Text-to-SQL đầu tiên đạt hiệu suất vượt trội so với con người trong các tác vụ phức tạp.
GeoRA từ Meituan và Đại học Bắc Kinh giúp tối ưu hóa quá trình huấn luyện RLVR bằng cách căn chỉnh hình học cập nhật, giúp giảm 99,5% tham số cần huấn luyện mà vẫn vượt trội hơn các phương pháp như LoRA hay PiSSA trên các tác vụ toán học, y tế và lập trình.
Nghiên cứu từ Apple cho thấy phương pháp GRPO duy trì hiệu suất ổn định trong các tác vụ suy luận đa ngôn ngữ, chứng minh RLVR vẫn cực kỳ hiệu quả ngay cả khi không sử dụng tiếng Anh làm ngôn ngữ huấn luyện chính.
Nghiên cứu chỉ ra rằng việc tối ưu hóa học tăng cường với bộ kiểm chứng (RLVR) có thể cải thiện hiệu suất hiện tại nhưng lại làm giảm khả năng khám phá các hành vi thành công trong tương lai, gây ra sự suy giảm đa dạng trong các phản hồi mô hình.
Nghiên cứu giới thiệu phương pháp 3PO, thay đổi cách khám phá trong học tăng cường cho LLM bằng cách lấy mẫu các tham số mô hình thay vì chỉ điều chỉnh phân phối đầu ra, giúp cải thiện hiệu suất huấn luyện.