Nghiên cứu mới từ AI2 và ĐH Washington chỉ ra rằng các phương pháp tự tiến hóa (Harness Evolution) phức tạp của AI Agent thường không vượt trội hơn so với chiến lược chạy thử nhiều lần (test-time scaling) đơn giản khi xét trên cùng ngân sách suy luận.
Test-time scaling has two axes: running agents over longer timeframes (depth), and running a larger …
DịchFrançois Chollet cho rằng việc mở rộng thời điểm kiểm thử không chỉ nằm ở việc kéo dài thời gian xử lý (chiều sâu), mà còn cần tăng số lượng tác nhân hoạt động song song (chiều rộng) để giải quyết các bài toán phức tạp đòi hỏi tìm kiếm không gian rộng.