# Co-RL: Đột phá khả năng suy luận không cần giám sát nhờ đa dạng hóa tác nhân trong học tăng cường

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-08-19 07:00 (giờ Việt Nam)
- Điểm AI: 51/100
- Link AIHOT.vn: https://aihot.vn/items/5b713864abe43fd9
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmt1257ui0md1ro2ode4lxy0m
- Link gốc: https://arxiv.org/abs/2608.17253

## Tóm tắt AI

Co-RL là khung học tăng cường đa tác nhân mới, cho phép các mô hình tự tối ưu hóa thông qua tín hiệu phần thưởng lẫn nhau mà không cần nhãn. Việc tăng cường tính đa dạng của nhóm giúp giảm lỗi phản hồi và cải thiện đáng kể hiệu suất trên các tác vụ văn bản và đa phương thức.

## Thân bài

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite

### Lịch sử gửi bài

Từ: Yunhao Yang [xem email] [v1] Thứ Ba, 18/08/2026 01:16:02 UTC (10.361 KB) [v2] Thứ Tư, 19/08/2026 05:41:44 UTC (10.361 KB)
