Elvis Saravia@omarsar0, DAIR.AI
Điểm AI 43/100

Ngành

AutoResearchExam: Bộ tiêu chuẩn mới đánh giá năng lực nghiên cứu của AI Agent

(giờ Việt Nam)

Nguyên văn trên X

This is a really neat benchmark. It's super interesting that Astra starts strong and holds the lead …

Dịch · tóm tắt AI

AutoResearchExam đánh giá khả năng tự nghiên cứu của AI trong 24 giờ qua 7 lĩnh vực chuyên sâu. Kết quả cho thấy Fable 5.1 đang dẫn đầu, trong khi Qwen, Gemini và Grok chiếm ưu thế về hiệu suất chi phí.

AI AgentAutoResearchExamĐánh giá AINghiên cứu AICông nghệ mới

Bài viết được AI dịch và tổng hợp tự động từ X: Elvis Saravia (@omarsar0, DAIR.AI). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

AutoResearchExam: Bộ tiêu chuẩn mới đánh giá năng lực nghiên cứu của AI Agent | AIHOT.vn