Video kiểm chứng hiệu năng thực tế của DeepSeek-V4-Pro-0813, giải đáp nghi vấn về khả năng suy luận so với bản Flash và liệu công cụ Harness có thực sự cải thiện chất lượng phản hồi.
Interesting new research from IBM. If you pick models from benchmark deltas, some of that delta bel…
DịchNghiên cứu BenchDrift từ IBM chỉ ra rằng các mô hình AI mạnh thường nhạy cảm với cách diễn đạt hơn cả mô hình yếu, khiến thứ hạng trên các bảng xếp hạng benchmark không phản ánh chính xác năng lực thực sự.
What are the big questions about AI capabilities that govern the impact AI will have on the world? I…
DịchGreg H. Burnham từ Epoch AI phân tích những thách thức then chốt quyết định tác động của AI đối với thế giới, đồng thời làm rõ cách các bộ tiêu chuẩn đánh giá của họ giúp giải quyết những vấn đề này.
Brilliant new paper from Meta. LLM judges get validated on accuracy against golden data. That says …
DịchNghiên cứu từ Meta cho thấy các mô hình ngôn ngữ lớn (LLM) dễ dàng thay đổi phán quyết khi bị gây áp lực hoặc phản biện, làm giảm đáng kể độ chính xác của kết quả đánh giá.
Regular reminder -- the set of public ARC 3 games is called "demonstration set", not "eval set" nor …
DịchFrançois Chollet nhấn mạnh bộ dữ liệu ARC 3 công khai chỉ mang tính chất minh họa, không phải chuẩn mực đánh giá. Điểm số 2,7% trên bảng xếp hạng hiện tại không phản ánh đúng năng lực thực tế của mô hình so với bộ dữ liệu kiểm tra kín.
Dù đạt điểm benchmark cao, Opus 5 lại gây khó chịu vì xu hướng tự ý suy diễn thay vì đặt câu hỏi làm rõ, khiến người dùng phải giám sát thủ công nhiều hơn. Tác giả cho rằng áp lực điểm số đã vô tình ưu tiên các mô hình 'liều lĩnh' thay vì sự cẩn trọng cần thiết trong lập trình.
Nhóm nghiên cứu từ ĐH Hồng Kông và Kuaishou giới thiệu PlayWorld, bộ tiêu chuẩn sử dụng AI Agent để đánh giá khả năng tương tác và duy trì tính nhất quán của các mô hình thế giới trong các kịch bản phức tạp.
We're launching Optima. Now anyone can create a custom benchmark for their use case, leveraging Arti…
DịchOptima cho phép người dùng xây dựng bộ tiêu chuẩn đánh giá riêng dựa trên dữ liệu cá nhân hoặc HuggingFace, giúp so sánh chính xác chi phí, tốc độ và hiệu suất giữa các mô hình AI hàng đầu để tối ưu hóa lựa chọn.
a16z đầu tư vào Vals, nền tảng thay thế các bài kiểm tra học thuật lỗi thời bằng hệ thống đánh giá tự động dựa trên quy trình làm việc thực tế, giúp đo lường chính xác hiệu suất AI trong môi trường doanh nghiệp.
Alibaba Cloud vừa giới thiệu Qwen AI Arena, nền tảng đánh giá và thử thách các AI Agent dựa trên các tình huống kinh doanh thực tế, bắt đầu với lĩnh vực thương mại điện tử xuyên biên giới.
Khảo sát từ 215 chuyên gia cho thấy các công cụ AI được FDA phê duyệt hiện chưa đạt hiệu quả như kỳ vọng trong việc giảm tỷ lệ gọi lại, giảm sinh thiết không cần thiết hay giảm áp lực công việc cho bác sĩ.
Qua thử nghiệm với 114 câu lệnh, Grok 4.6 vượt trội nhờ khả năng phân tích dữ liệu thiên văn chuẩn xác và khai thác cấu trúc ẩn sau vấn đề, dù đôi khi còn quá sa đà vào các diễn giải trừu tượng.
Sau hai tuần ra mắt, Seedance 2.5 đang gây sốt trong cộng đồng AI. Bài viết này kiểm chứng thực tế liệu chất lượng video của mô hình có xứng đáng với sự kỳ vọng và làn sóng quảng bá mạnh mẽ hiện nay.
Announcing AA-AnalystAgent, our new agentic benchmark for quantitative analysis on real-world spread…
DịchArtificial Analysis vừa công bố bộ tiêu chuẩn AA-AnalystAgent để đánh giá khả năng phân tích dữ liệu thực tế. Claude 3.5 Opus (bản max) hiện đang dẫn đầu với 54%, vượt qua GPT-5.5 và Kimi K3 trong các tác vụ xử lý bảng tính và tài liệu.