Elvis Saravia@omarsar0NgànhĐiểm AI 43/100
AutoResearchExam: Bộ tiêu chuẩn mới đánh giá năng lực nghiên cứu của AI Agent
This is a really neat benchmark. It's super interesting that Astra starts strong and holds the lead …
DịchAutoResearchExam đánh giá khả năng tự nghiên cứu của AI trong 24 giờ qua 7 lĩnh vực chuyên sâu. Kết quả cho thấy Fable 5.1 đang dẫn đầu, trong khi Qwen, Gemini và Grok chiếm ưu thế về hiệu suất chi phí.