WhatWorkedBench: Bộ tiêu chuẩn đánh giá khả năng thấu hiểu thực nghiệm của AI Agent
WhatWorkedBench là bộ benchmark mới giúp đo lường khả năng dự đoán hiệu quả các thay đổi thành phần trong điều kiện ngân sách hạn chế của AI Agent, thông qua phân tích 1.248 bản ghi cấu hình và 108 tập dữ liệu thực nghiệm.















