24/09

Thứ Năm · 2 tin
Tencent Hunyuan@TencentHunyuan
Nghiên cứuĐiểm AI 40/100

Cùng sự kiệnTencent Hunyuan: Nghiên cứu tối ưu hóa kích thước batch trong học tăng cường cho LLM

⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training effi…

DịchNghiên cứu từ Tencent Hunyuan cho thấy việc điều chỉnh learning rate giúp tăng hiệu suất huấn luyện GRPO và PPO, giúp tăng tốc độ xử lý lên 2,29 lần và tiết kiệm 29% thời gian huấn luyện.

Cùng sự kiện, bài đại diện «Tencent Hunyuan: Nghiên cứu mở rộng kích thước batch trong học tăng cường LLM»
Tencent Hunyuan@TencentHunyuan
Nghiên cứuĐiểm AI 39/100

Tencent Hunyuan: Nghiên cứu mở rộng kích thước batch trong học tăng cường LLM

⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training effi…

DịchNhóm nghiên cứu Tencent Hunyuan tối ưu hóa học tăng cường cho LLM bằng cách mở rộng kích thước batch, giúp tăng tốc độ xử lý của PPO lên 2,29 lần và rút ngắn 29% thời gian huấn luyện GRPO mà vẫn đảm bảo hiệu suất.

17/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 35/100

Tối ưu hóa PPO: Giải mã hiện tượng 'phẳng hóa giá trị' và giải pháp SP3O đột phá

Nghiên cứu chỉ ra lỗi 'phẳng hóa giá trị' khiến mô hình PPO dự đoán thiếu chính xác. Giải pháp SP3O giúp khắc phục bằng cách giám sát chọn lọc các trạng thái quan trọng, giúp cải thiện hiệu suất đáng kể trên các mô hình ngôn ngữ lớn.

Tổng 3 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (17 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “PPO” | AIHOT.vn