# Tối ưu hóa huấn luyện RL hậu kỳ với kỹ thuật Online Draft Co-Training cho mô hình ngữ cảnh dài

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-09 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/95ae95f40b235212
- Link gốc: https://arxiv.org/abs/2609.07108

## Tóm tắt AI

Nghiên cứu giới thiệu hệ thống mới giúp tăng tốc tạo rollout trong huấn luyện RL bằng cách cải tiến speculative decoding, giải quyết các rào cản về branch attention và pipeline-parallelism khi xử lý ngữ cảnh dài.

## Thân bài

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Zili Wang [xem email] [v1] Thứ Hai, 7 tháng 9 năm 2026 06:48:29 UTC (219 KB)
