Nghiên cứuĐiểm AI 51/100
Co-RL: Đột phá khả năng suy luận không cần giám sát nhờ đa dạng hóa tác nhân trong học tăng cường
Co-RL là khung học tăng cường đa tác nhân mới, cho phép các mô hình tự tối ưu hóa thông qua tín hiệu phần thưởng lẫn nhau mà không cần nhãn. Việc tăng cường tính đa dạng của nhóm giúp giảm lỗi phản hồi và cải thiện đáng kể hiệu suất trên các tác vụ văn bản và đa phương thức.