23/08

Chủ Nhật · 2 tin

22/08

Thứ Bảy · 1 tin
Gabriel@gabriel1
Hướng dẫnĐiểm AI 18/100

Cách đánh giá AI: Tập trung vào trải nghiệm người dùng thay vì các chỉ số ảo

any recommendations for someone in evals that care more about the behavior and experience for the us…

DịchLời khuyên cho đội ngũ đánh giá mô hình AI: Hãy ưu tiên phân tích hành vi và trải nghiệm thực tế của người dùng thay vì chỉ dựa vào các con số benchmark mang tính hình thức.

21/08

Thứ Sáu · 4 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 53/100

Bảng xếp hạng MLCR-AA: Claude Fable 5 dẫn đầu về khả năng suy luận y tế

Announcing MLCR-AA, our leaderboard for Wisedocs' MLCR (Medical Long Context Reasoning) benchmark fo…

DịchArtificial Analysis vừa công bố bảng xếp hạng MLCR-AA cho các mô hình AI trong lĩnh vực y tế. Claude Fable 5 xuất sắc giành vị trí quán quân với 64,4%, trong khi phần lớn các mô hình khác đạt kết quả dưới 15%.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NARU: Bộ tiêu chuẩn đánh giá khả năng hiểu diễn biến cốt truyện và sắc thái văn hóa trong video dài tiếng Nhật

NARU là bộ benchmark mới gồm 1.481 câu hỏi dựa trên 146 giờ video, giúp đánh giá sâu khả năng suy luận về diễn biến cốt truyện và các yếu tố văn hóa đặc thù trong video dài, vốn là điểm yếu của các mô hình AI hiện nay.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

Vạch trần lỗ hổng: Các mô hình ASR hàng đầu đang 'học vẹt' để đạt điểm chuẩn cao

Nghiên cứu mới chỉ ra rằng các mô hình ASR hàng đầu có xu hướng 'học vẹt' văn bản tham chiếu thay vì thực sự hiểu âm thanh, dẫn đến điểm số ảo dù dữ liệu đầu vào bị nhiễu hoặc thiếu hụt.

20/08

Thứ Năm · 2 tin

19/08

Thứ Tư · 5 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 13/100

Tiêu chuẩn đánh giá AI mới: Tự động thất bại nếu phát hiện có sự can thiệp của con người

Next benchmark: detect human, choose literally anywhere else.

DịchMột phương pháp kiểm thử AI mới đang được đề xuất: hệ thống sẽ tự động đánh giá là thất bại nếu phát hiện có sự tham gia hoặc hỗ trợ từ con người trong quá trình thực hiện tác vụ.

Ethan Mollick@emollick
Hướng dẫnĐiểm AI 36/100

Đánh giá thực tế: Qwen 27B vẫn chưa thể soán ngôi các mô hình AI hàng đầu

Qwen 27B is really good local model but, when you use it, it is immediately absolutely and obviously…

DịchDù là một mô hình chạy cục bộ ấn tượng, Qwen 27B vẫn bộc lộ hạn chế rõ rệt trong các tác vụ phức tạp và điều khiển tác nhân (agent) so với các đối thủ đầu bảng. Người dùng nên tự kiểm chứng qua các bài benchmark thực tế thay vì chỉ nhìn vào thông số.

Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 44/100

Ra mắt nền tảng Optima: Tự thiết lập bài kiểm tra hiệu năng mô hình AI

Last week we launched Optima, a new platform for benchmarking models on your own workloads and compa…

DịchNền tảng Optima mới cho phép người dùng tự chạy các bài kiểm tra hiệu năng trên chính khối lượng công việc của mình, giúp so sánh chính xác tốc độ, chi phí và chất lượng giữa các mô hình AI.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 46/100

Nghiên cứu Stanford: Các bảng xếp hạng AI hiện nay không phản ánh đúng độ tin cậy của Agent

New Stanford paper shows a leaderboard can tell you which agent scored highest on that benchmark, bu…

DịchNghiên cứu mới từ Stanford chỉ ra rằng các bảng xếp hạng AI hiện tại thiếu tính dự báo thực tế, khi độ tin cậy của các Agent giảm mạnh trong các tác vụ khó và không có sự tương quan với hiệu suất thực tế.

18/08

Thứ Ba · 7 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnKỷ nguyên Harness trong đánh giá AI: 15 tổ chức học thuật ra mắt HarnessEval

HarnessEval định nghĩa lại cách đánh giá các hệ thống AI phức tạp bằng cách xây dựng một quy trình kiểm chứng có hệ thống, thay vì chỉ dựa vào các mô hình chấm điểm đơn thuần.


Vì sao đáng đọc: Bài viết đề cập đến một xu hướng quan trọng trong việc đánh giá Agent AI, kết nối giữa kỹ thuật hệ thống và tiêu chuẩn đo lường, có giá trị cao cho cộng đồng nghiên cứu.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 65/100

Ngày tàn của các bài kiểm tra năng lực AI: Khi LLM dễ dàng 'gian lận' điểm số

Tác giả cảnh báo rằng LLM đang khiến các bộ tiêu chuẩn đánh giá (benchmark) mất đi độ tin cậy do khả năng tối ưu hóa quá mức cho dữ liệu huấn luyện. Thực nghiệm cho thấy AI có thể tạo ra mã nhanh hơn trên tập dữ liệu công khai nhưng lại thất bại thảm hại khi đối mặt với các bài kiểm tra thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

HarnessEval-W: Đưa phương pháp đánh giá dựa trên tác nhân vào các mô hình thế giới

HarnessEval-W giới thiệu quy trình đánh giá mới cho mô hình thế giới bằng cách chia nhỏ vấn đề thành các tác nhân con để suy luận và xác thực. Phương pháp này giúp tạo ra chuỗi suy luận có thể kiểm chứng, đạt độ chính xác cao so với đánh giá của con người trên 18 mô hình tiêu biểu.

17/08

Thứ Hai · 1 tin

16/08

Chủ Nhật · 1 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 42/100

Nghiên cứu của IBM: Điểm số benchmark AI phụ thuộc nhiều vào cách đặt câu hỏi hơn là năng lực thực tế

Interesting new research from IBM. If you pick models from benchmark deltas, some of that delta bel…

DịchNghiên cứu BenchDrift từ IBM chỉ ra rằng các mô hình AI mạnh thường nhạy cảm với cách diễn đạt hơn cả mô hình yếu, khiến thứ hạng trên các bảng xếp hạng benchmark không phản ánh chính xác năng lực thực sự.

15/08

Thứ Bảy · 1 tin

14/08

Thứ Sáu · 5 tin
Francois Chollet@fchollet
Hướng dẫnĐiểm AI 48/100

François Chollet cảnh báo: Đừng dùng bộ dữ liệu ARC 3 công khai để đánh giá AI

Regular reminder -- the set of public ARC 3 games is called "demonstration set", not "eval set" nor …

DịchFrançois Chollet nhấn mạnh bộ dữ liệu ARC 3 công khai chỉ mang tính chất minh họa, không phải chuẩn mực đánh giá. Điểm số 2,7% trên bảng xếp hạng hiện tại không phản ánh đúng năng lực thực tế của mô hình so với bộ dữ liệu kiểm tra kín.

cb_doge@cb_doge
Hướng dẫnĐiểm AI 26/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng Realm Tax

Grok 4.6 wins again. 🏆 Grok 4.6 is #1 on micro1's Realm Tax benchmark with a 57.9% Best@3 score, b…

DịchGrok 4.6 vừa thiết lập cột mốc mới khi dẫn đầu bài kiểm tra Realm Tax (micro1) với điểm số Best@3 đạt 57.9%, vượt qua hàng loạt đối thủ sừng sỏ như Claude, GPT và Gemini.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 60/100

Artificial Analysis ra mắt Optima: Nền tảng tùy chỉnh benchmark cho mô hình AI

We've just added $10 credit for any new sign ups to Optima for a limited time only. Try it out and l…

DịchOptima cho phép người dùng tạo các bài kiểm tra hiệu năng riêng biệt dựa trên dữ liệu thực tế, giúp so sánh tốc độ, chi phí và chất lượng giữa các mô hình AI hàng đầu để tìm ra giải pháp tối ưu nhất.

13/08

Thứ Năm · 5 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

AutoWorldModel-Bench: Thước đo chuẩn cho nghiên cứu mô hình thế giới tự động

AutoWorldModel-Bench là bộ tiêu chuẩn mới cho phép các tác nhân AI tự động cải tiến mô hình thế giới trong môi trường game, giúp đánh giá khả năng nghiên cứu độc lập thay vì chỉ thực hiện các tác vụ lập trình theo yêu cầu.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 62/100

Cùng sự kiệnGrok 4.6 của SpaceXAI đạt 61 điểm trên bảng xếp hạng Artificial Analysis

Grok 4.6 đạt 61 điểm trên Artificial Analysis, ngang bằng GPT-5.6 Sol nhưng có chi phí rẻ hơn 60%. Với cửa sổ ngữ cảnh 500k token và hiệu suất ấn tượng, đây là lựa chọn tối ưu về kinh tế cho người dùng.

Cùng sự kiện, tinh chọn hiển thị «Cursor hợp tác cùng SpaceXAI ra mắt Grok 4.6: Bước tiến mới trong lập trình AI»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 41/100

Grok 4.6 bứt phá mạnh mẽ, vượt xa hiệu suất của phiên bản 4.5

Grok 4.6 is a huge improvement over Grok 4.5 🚀 Mercor's APEX benchmark shows major gains across ev…

DịchGrok 4.6 ghi nhận bước tiến vượt bậc trong các bài kiểm tra APEX của Mercor, với sự cải thiện đáng kể về năng lực xử lý trong các lĩnh vực chuyên môn như luật doanh nghiệp, ngân hàng đầu tư, tư vấn quản lý và kế toán.

cb_doge@cb_doge
Mô hìnhĐiểm AI 58/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng ARI Bench, vượt mặt cả Claude và GPT

Grok 4.6 takes the #1 spot on ARI Bench - the benchmark for recursive AI improvement. 🥇 It signifi…

DịchGrok 4.6 vừa thiết lập cột mốc mới trên ARI Bench - thước đo khả năng tự cải tiến đệ quy của AI. Phiên bản này không chỉ bỏ xa người tiền nhiệm Grok 4.5 mà còn vượt qua các đối thủ sừng sỏ như Claude Opus 5 và GPT-5.6.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»

12/08

Thứ Tư · 3 tin
X.PIN@thexpin
Mô hìnhĐiểm AI 59/100

Cùng sự kiệnDeepSeek V4 Pro chính thức ra mắt: So sánh hiệu năng với bản thử nghiệm

JUST IN: Deepseek V4 Pro has just released. A quick glance at latest benchmarks comparing with V4 pr…

DịchDeepSeek vừa trình làng phiên bản V4 Pro. Hãy cùng điểm qua những kết quả kiểm thử hiệu năng mới nhất so với bản xem trước (preview) trước đó.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
cb_doge@cb_doge
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnGrok 4.6 chính thức ra mắt: Thiết lập hàng loạt kỷ lục mới trên các bảng xếp hạng AI

Grok 4.6 is a massive upgrade 🚀 It beats Grok 4.5 High across every benchmark listed and now ranks…

DịchGrok 4.6 mang đến bước tiến lớn khi vượt qua phiên bản tiền nhiệm ở mọi bài kiểm tra, đồng thời đạt điểm số ngang bằng với GPT-5.6 Sol Max trên bảng xếp hạng Artificial Analysis. Người dùng hiện đã có thể trải nghiệm mô hình này thông qua Cursor và Grok Build.

Cùng sự kiện, tinh chọn hiển thị «Grok 4.6 chính thức ra mắt: Thông minh, tốc độ vượt trội và tối ưu chi phí»
Tổng 36 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (44 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Benchmark” — Trang 4 | AIHOT.vn