DeepSeek-AI giới thiệu DeepSeek Elastic Compute (DSec), nền tảng sandbox cấp sản xuất hỗ trợ huấn luyện và đánh giá RL cho các tác nhân AI thông qua bốn cơ chế backend linh hoạt.
DeepSeek giới thiệu DSec, nền tảng sandbox hỗ trợ huấn luyện RL cho AI Agent với khả năng xử lý 3 triệu sandbox mỗi ngày và hơn 380.000 kết nối đồng thời, theo báo cáo kỹ thuật arXiv 2609.22978.
Exciting work from NVIDIA. (bookmark it) Interesting to see this approach to turn public Agent Ski…
DịchNVIDIA giới thiệu Skill2Env, công cụ chuyển đổi hơn 3.400 kỹ năng Agent thành gần 8.000 nhiệm vụ RL thực thi được trên 13 lĩnh vực, sử dụng GPT-5.6 Sol với chi phí API lên tới 90.000 USD.
Nghiên cứu giải quyết tình trạng mất ổn định khi huấn luyện RL cho LLM bằng FP8, vốn gây ra lỗi sai lệch gradient và làm giảm chất lượng mô hình. Nhóm tác giả đề xuất phương pháp mới giúp duy trì độ chính xác và hiệu suất huấn luyện ổn định hơn.
Bài viết phân tích chiến lược tối ưu hóa Batch Size trong huấn luyện Reinforcement Learning (RL) quy mô lớn, giúp cân bằng giữa hiệu suất tính toán và thời gian huấn luyện để tiết kiệm chi phí vận hành hàng triệu USD.
Vì sao đáng đọc: Chủ đề cực kỳ thực tế cho các kỹ sư AI và doanh nghiệp đang chạy mô hình lớn, phân tích sâu về bài toán tối ưu hóa chi phí và hiệu suất phần cứng.
Nghiên cứu giới thiệu khung huấn luyện tác nhân AI dựa trên việc phân loại nhiệm vụ kỹ thuật phần mềm, giúp giải quyết tình trạng hiệu suất không đồng đều giữa các nhóm tác vụ khác nhau thông qua cơ chế củng cố hành vi và chọn lọc tác vụ thích ứng.
Strong agree. There's way less of this than I would expect - partially due to the fact that making a…
DịchCác chuyên gia nhận định việc phát hành môi trường Reinforcement Learning (RL) chất lượng cao có tầm ảnh hưởng tương đương với việc chia sẻ dữ liệu tiền huấn luyện, đặc biệt trong kỷ nguyên RLVR mới.
releasing many high quality open-source RL environments is the most impactful thing anyone can do to…
DịchThomas Wolf cho rằng việc chia sẻ môi trường RL mã nguồn mở là chìa khóa thúc đẩy AI, tương đương với việc cung cấp dữ liệu huấn luyện chất lượng cao cho mô hình RLVR. Một nhóm nghiên cứu đã chứng minh hiệu quả khi đạt top 6 bảng xếp hạng chỉ trong 1 tuần nhờ phương pháp này.
Bản tin tổng hợp 10 nội dung nổi bật, tiêu điểm là công thức huấn luyện RL cho Agent 397B từ các chuyên gia OpenAI o1 và tác giả LoRA, giúp cải thiện hiệu suất Pass@1 lên tới 70%.
Meshy là khung huấn luyện RL mới giúp loại bỏ sự phụ thuộc vào các framework điều phối phức tạp như Ray, thay vào đó sử dụng kiến trúc hướng dữ liệu và SPMD để tối ưu hóa hiệu suất và khả năng mở rộng cho các hệ thống RL hiện đại.
Super cool paper from Microsoft. They show that it's possible to build competitive small coding ag…
DịchMicrosoft giới thiệu FrogNano, mô hình lập trình 4B tham số được huấn luyện hoàn toàn bằng học tăng cường (RL) mà không cần chưng cất tri thức từ các mô hình lớn. Phương pháp này chứng minh rằng việc tập trung vào các tác vụ tự tổng hợp phù hợp với khả năng của mô hình giúp tối ưu hiệu suất vượt trội.
Banger report from Microsoft. (bookmark it) They show that it's possible to build competitive smal…
DịchMicrosoft giới thiệu FrogNano, mô hình 4B tham số tự học lập trình trên 1.500 môi trường phần mềm bằng Reinforcement Learning mà không cần chưng cất từ mô hình lớn. Điểm đột phá nằm ở quy trình tổng hợp nhiệm vụ trực tuyến giúp tối ưu hóa khả năng học tập của mô hình.
Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.
New Meta paper says giving an agent more memory and tools is not enough if the agent never learns wh…
DịchNghiên cứu mới từ Meta giới thiệu EvoHarness-RL, phương pháp huấn luyện RL giúp AI tự quyết định thời điểm dùng công cụ thay vì truy cập liên tục, giúp Qwen3-8B tăng vọt hiệu suất giải quyết tác vụ phức tạp.