16/09

Thứ Tư · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 85/100

Harness Evolution cho AI Agent: Liệu có thực sự hiệu quả hơn việc chạy thử nhiều lần?

Nghiên cứu mới từ AI2 và ĐH Washington chỉ ra rằng các phương pháp tự tiến hóa (Harness Evolution) phức tạp của AI Agent thường không vượt trội hơn so với chiến lược chạy thử nhiều lần (test-time scaling) đơn giản khi xét trên cùng ngân sách suy luận.

01/09

Thứ Ba · 1 tin
Francois Chollet@fchollet
Hướng dẫnĐiểm AI 24/100

François Chollet: Mở rộng thời điểm kiểm thử (Test-time Scaling) gồm hai chiều: Chiều sâu và Chiều rộng

Test-time scaling has two axes: running agents over longer timeframes (depth), and running a larger …

DịchFrançois Chollet cho rằng việc mở rộng thời điểm kiểm thử không chỉ nằm ở việc kéo dài thời gian xử lý (chiều sâu), mà còn cần tăng số lượng tác nhân hoạt động song song (chiều rộng) để giải quyết các bài toán phức tạp đòi hỏi tìm kiếm không gian rộng.

Tổng 2 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (18 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Test-time Scaling” | AIHOT.vn