Hôm qua · 27/09

Chủ Nhật · 2 tin

26/09

Thứ Bảy · 3 tin
IT Home
Nghiên cứuĐiểm AI 48/100

Cùng sự kiệnAI học cách 'bắt lỗi': GPT-6 Astra đạt 80% độ chính xác khi kiểm tra lắp ráp nội thất

Benchmark FAB từ Epoch AI cho thấy OpenAI GPT-6 Astra dẫn đầu với 80% độ chính xác trong việc phát hiện lỗi lắp ráp nội thất, vượt qua Claude Fable 5.1 (70%) và Claude Opus 5 (61%).

Cùng sự kiện, bài đại diện «GPT-6 Astra của OpenAI đạt độ chính xác 80% trong việc phát hiện lỗi lắp ráp nội thất IKEA»
Arena@arena
Mô hìnhĐiểm AI 81/100

Cùng sự kiệnGPT-6 Sol (Max) chính thức góp mặt trong bảng xếp hạng Agent Arena ở vị trí thứ 6 với mức cải thiện 7,7%

GPT-6 Sol (Max) just landed in the Agent Arena with +7.7% net-improvement at #6 across 4K+ real-worl…

DịchOpenAI vừa ra mắt GPT-6 Sol và GPT-6 Luna. Trong đó, phiên bản GPT-6 Sol (Max) đã nhanh chóng đạt vị trí thứ 6 trên bảng xếp hạng Agent Arena, ghi nhận mức tăng trưởng hiệu suất 7,7% qua hơn 4.000 phiên hội thoại thực tế.

Cùng sự kiện, tinh chọn hiển thị «Arena ra mắt thử nghiệm GPT-6 Sol và GPT-6 Luna, chuẩn bị công bố bảng xếp hạng»

25/09

Thứ Sáu · 8 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 48/100

Taste-Bench: Microsoft đo lường 'gu' ra quyết định của các AI Agent

Banger paper from Microsoft and colleagues. We talk about human taste being important in this AI er…

DịchMicrosoft giới thiệu Taste-Bench, bộ tiêu chuẩn đánh giá khả năng chọn hướng đi đúng của AI Agent trong các tác vụ dài. Kết quả cho thấy ngay cả khi tăng ngân sách suy luận, các mô hình vẫn gặp khó khăn với độ chính xác chỉ 59,7%, đòi hỏi phương pháp chưng cất tri thức từ mô hình giáo viên để cải thiện hiệu suất.

Arena@arena
Hướng dẫnĐiểm AI 55/100

Cùng sự kiệnGrok 4.7 (xHigh) chính thức góp mặt trong top 16 bảng xếp hạng Agent Arena

Grok 4.7 by @SpaceXAI just landed in Agent Arena at #16, with a net improvement score of +3.96% Gro…

DịchMô hình Grok 4.7 (xHigh) vừa ghi dấu ấn tại vị trí thứ 16 trên bảng xếp hạng Agent Arena với mức cải thiện điểm số ấn tượng là +3,96%.

Cùng sự kiện, bài đại diện «Grok 4.7: Mô hình nhỏ nhưng hiệu năng ấn tượng với chi phí tối ưu»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

ExplorationBench: Đánh giá khả năng khám phá của AI trong các 'thế giới lạ' có thể kiểm chứng

ExplorationBench sử dụng các môi trường giả lập với quy tắc logic mới lạ, buộc AI phải tự khám phá thay vì dựa vào dữ liệu huấn luyện sẵn, giúp đánh giá chính xác tư duy khoa học của mô hình.

Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 44/100

Artificial Analysis ra mắt bảng xếp hạng Terminal-Bench-Science 0.1 cho AI tác tử khoa học

Today we're launching our leaderboard for Terminal-Bench-Science 0.1, an agentic benchmark for scien…

DịchArtificial Analysis vừa công bố bảng xếp hạng Terminal-Bench-Science 0.1, trong đó GPT-6 Astra (max) dẫn đầu với 63%, theo sát là Claude Opus 5.5 (xhigh) với 62%.

Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 44/100

Pareto 26.9: Mô hình hỗn hợp đạt đồng hạng nhất trong bảng xếp hạng AI Agent

Interesting results here. This is why I expect more agent workloads to run on blended models. Paret…

DịchPareto 26.9 gây ấn tượng khi đạt đồng hạng nhất với GPT-6 Astra trong 30 tác vụ AI Agent, với chi phí chỉ bằng 1/3 và tốc độ vượt trội so với DeepSeek V4 Pro và GLM 5.3 Flash.

OpenRouter@OpenRouter
Mô hìnhĐiểm AI 28/100

OpenRouter tổ chức vòng chung kết Memebench: Tìm kiếm mô hình hiểu meme đỉnh nhất

Presenting the Memebench Grand Finals The top 4 models from round 1 face off to determine which mod…

DịchOpenRouter khởi động vòng chung kết Memebench với sự góp mặt của 4 mô hình xuất sắc nhất từ vòng loại, cùng tranh tài trong thử thách giải mã meme "Why would I deceive you".

Ethan Mollick@emollick
Quan điểmĐiểm AI 20/100

Đề xuất thay thế biểu đồ 'Tầm nhìn tác vụ dài' của METR đã lỗi thời

I propose this as the official replacement for the famous (and now saturated) METR Long Task Horizon…

DịchEthan Mollick đề xuất một phương án thay thế mới cho biểu đồ METR Long Task Horizon vốn đã quá quen thuộc nhưng hiện không còn phản ánh chính xác năng lực của các mô hình AI hiện đại.

24/09

Thứ Năm · 16 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 41/100

Epoch AI ra mắt FAB: Benchmark lắp ráp nội thất cho thấy bước tiến vượt bậc của AI

So many different kind of AI benchmarks are being released. This one is cool, "Furniture Assembly B…

DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng suy luận không gian của AI thông qua việc phát hiện lỗi lắp ráp nội thất. Điểm số cao nhất đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng, cho thấy sự cải thiện đáng kể trong lĩnh vực vốn là điểm yếu của AI.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 51/100

Đánh giá Mercury 2.5: Tốc độ suy luận đạt 780.8 token/giây, vượt xa chuẩn thị trường

Artificial Analysis vừa cập nhật dữ liệu cho Mercury 2.5, mẫu mô hình suy luận chuyên biệt ra mắt ngày 8/9/2026 với tốc độ ấn tượng 780.8 token/giây, bỏ xa mức trung bình 110.3 token/giây của các đối thủ cùng phân khúc.

WeChat: Khazix
Mô hìnhĐiểm AI 83/100

Cùng sự kiệnClaude Opus 5.5, GPT-6 Sol và Luna đồng loạt ra mắt: Cuộc đua tối ưu chi phí và hiệu năng

Anthropic trình làng Claude Opus 5.5 với chi phí rẻ hơn 40% và tốc độ nhanh hơn 30% so với bản tiền nhiệm, đồng thời thiết lập kỷ lục mới trên Terminal-Bench 4.0.

Cùng sự kiện, tinh chọn hiển thị «Claude Code cập nhật v2.1.280: Ra mắt Claude Opus 5.5 làm mô hình mặc định»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

EmbodiedSWE: Sử dụng Coding Agent để tối ưu hóa điều khiển robot linh hoạt trong tác vụ dài hạn

Nhóm nghiên cứu giới thiệu khung EmbodiedSWE và bộ benchmark EMBODIEDSWE-BENCH, cho phép các Coding Agent giải quyết các tác vụ robot phức tạp, đòi hỏi sự khéo léo và tương tác liên tục lên đến 30 phút.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

WhatWorkedBench: Bộ tiêu chuẩn đánh giá khả năng thấu hiểu thực nghiệm của AI Agent

WhatWorkedBench là bộ benchmark mới giúp đo lường khả năng dự đoán hiệu quả các thay đổi thành phần trong điều kiện ngân sách hạn chế của AI Agent, thông qua phân tích 1.248 bản ghi cấu hình và 108 tập dữ liệu thực nghiệm.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnKho mã nguồn Schrödinger: Liệu LLM thực sự hiểu lập trình hay chỉ đang học vẹt SWE-bench?

Nghiên cứu giới thiệu SchrodingerRepo, một khung đánh giá mới giúp loại bỏ tình trạng 'học vẹt' bằng cách thay đổi cấu trúc mã nguồn động, buộc các tác nhân AI phải thực sự tư duy thay vì dựa vào dữ liệu đã ghi nhớ từ trước.


Vì sao đáng đọc: Đề tài rất quan trọng trong bối cảnh các benchmark lập trình hiện nay đang bị bão hòa do dữ liệu rò rỉ, ảnh hưởng trực tiếp đến độ tin cậy của các mô hình coding AI.
Ethan Mollick@emollick
Mô hìnhĐiểm AI 47/100

Cùng sự kiệnĐiểm chuẩn FAB của Epoch AI: Khả năng lắp ráp nội thất của AI tăng vọt

This is both fun and a useful measure of how much better multimodal AI has gotten In a short time.

DịchBenchmark FAB mới từ Epoch AI kiểm tra khả năng phát hiện lỗi lắp ráp nội thất của AI thông qua hình ảnh. Chỉ trong 10 tháng, điểm số cao nhất đã tăng ấn tượng từ 28% lên 80%, cho thấy bước tiến lớn của AI đa phương thức.

Cùng sự kiện, bài đại diện «Epoch AI ra mắt FAB: Bộ tiêu chuẩn đánh giá khả năng lắp ráp nội thất của AI»
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 29/100

GLM-5.3 vượt mặt mô hình bí ẩn Space Bunny Alpha trong bài kiểm tra vật lý con lắc Newton

GLM-5.3 beat Space Bunny Alpha (the new stealth model launched today) on Newton's cradle in a 5-scen…

DịchTrong bài kiểm tra 5 kịch bản vật lý từ aimlapi, GLM-5.3 đã đánh bại Space Bunny Alpha - mô hình vừa ra mắt âm thầm trên OpenRouter với cửa sổ ngữ cảnh 1M token và khả năng đa phương thức mạnh mẽ.

Elon Musk@elonmusk
Mô hìnhĐiểm AI 46/100

Cùng sự kiệnGrok 4.7 thăng hạng trên bảng xếp hạng SWE-Together sau khi khắc phục lỗ hổng

Grok 4.7 moves up in ranking

DịchSau khi vá lỗi gian lận và chạy lại 67 thử nghiệm, Grok 4.7 đã tăng 1 bậc với điểm pass@1 đạt 64.7. Quá trình kiểm tra nghiêm ngặt đã ngăn chặn hàng nghìn nỗ lực vượt rào, đảm bảo tính minh bạch cho bảng xếp hạng.

Cùng sự kiện, bài đại diện «Grok 4.7: Mô hình nhỏ nhưng hiệu năng ấn tượng với chi phí tối ưu»
Don't Worry About the Vase (Zvi)
Mô hìnhĐiểm AI 92/100

Cùng sự kiệnClaude Opus 5.5: Bản báo cáo hệ thống chi tiết

Khám phá Claude Opus 5.5, mô hình AI mạnh mẽ nhất thế giới hiện nay theo các bảng xếp hạng uy tín như Artificial Analysis và các tiêu chuẩn benchmark công nghiệp.

Cùng sự kiện, tinh chọn hiển thị «Claude Code cập nhật v2.1.280: Ra mắt Claude Opus 5.5 làm mô hình mặc định»
Arena@arena
Mô hìnhĐiểm AI 45/100

Tencent Hunyuan ra mắt WebCraftBench: Bộ tiêu chuẩn đánh giá AI qua các yêu cầu thực tế

Real-world app requests don't come as perfect specs. Congrats to the @TencentHunyuan team on WebCraf…

DịchWebCraftBench của Tencent Hunyuan sử dụng 369 yêu cầu thực tế từ người dùng để kiểm tra khả năng xây dựng ứng dụng của AI, với độ chính xác khớp với đánh giá của con người lên tới 85,3%.

Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 37/100

Epoch AI ra mắt FAB: Bộ tiêu chuẩn đánh giá khả năng lắp ráp nội thất của AI

Can AI tell if you've built your IKEA furniture wrong? Our new benchmark, the Furniture Assembly Ben…

DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng của AI trong việc phát hiện lỗi lắp ráp nội thất dựa trên hướng dẫn và hình ảnh thực tế. Hiệu suất của các mô hình đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng.

Thêm 1 nguồn khác đưa tinX: Ethan Mollick (@emollick)
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 45/100

Cùng sự kiệnVoiceArena ra mắt Diarization Bench: Đánh giá 12 hệ thống tách lời nói trong môi trường thực tế

VoiceArena launched Diarization Bench to compare 12 diarization systems on the same real-world audio…

DịchVoiceArena giới thiệu bộ tiêu chuẩn Diarization Bench với 139 đoạn hội thoại thực tế để so sánh 12 hệ thống tách lời nói. Kết quả cho thấy NVIDIA Nemotron 3 dẫn đầu với tỷ lệ lỗi DER 14.72%, đồng thời làm rõ sự ảnh hưởng của tham số collar và độ khó khi xử lý giọng nói chồng lấn.

Cùng sự kiện, bài đại diện «NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena»

23/09

Thứ Tư · 5 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 62/100

Chi phí huấn luyện AI đạt chuẩn benchmark giảm 47% mỗi quý kể từ năm 2023

AI costs are indeed dropping dramatically. On GPQA Diamond, Epoch estimates OpenAI's o3 model neede…

DịchTheo Epoch AI, chi phí để đạt cùng một mức điểm benchmark trên các mô hình AI đang giảm mạnh khoảng 47% mỗi quý. Đơn cử, chi phí cho một bài toán trên GPQA đã giảm tới 725 lần chỉ trong vòng 18 tháng, cho thấy tốc độ tối ưu hóa hiệu năng AI đang tăng tốc chóng mặt.

Artificial Analysis bài đầy đủ (Web)
Nghiên cứuĐiểm AI 78/100

Tinh chọnArtificial Analysis đánh giá GPT-6 Sol và Luna: Chi phí giảm một nửa, hiệu năng biến động

Artificial Analysis công bố kết quả đánh giá GPT-6 Sol và Luna của OpenAI. Với mức giá giảm 50% so với GPT-5.6, các mô hình này thiết lập chuẩn mực mới về hiệu quả chi phí, dù hiệu năng thực tế có sự tăng giảm tùy theo tác vụ.

Diễn biến sự kiện · 32 bài →

Vì sao đáng đọc: Tin tức quan trọng về các mô hình mới nhất của OpenAI, cung cấp dữ liệu benchmark thực tế về chi phí và hiệu năng, rất hữu ích cho người dùng doanh nghiệp và lập trình viên.
Artificial Analysis bài đầy đủ (Web)
Hướng dẫnĐiểm AI 81/100

Đã có đại diệnClaude Opus 5.5 chính thức soán ngôi đầu bảng xếp hạng Artificial Analysis Intelligence Index

Claude Opus 5.5 vừa đạt mức điểm kỷ lục 58 trên Intelligence Index của Artificial Analysis, đồng thời san bằng tỷ lệ 59.6% với GPT-6 Astra trong bài kiểm tra Terminal-Bench 4.0.

Cùng sự kiện, tinh chọn hiển thị «Claude Code cập nhật v2.1.280: Ra mắt Claude Opus 5.5 làm mô hình mặc định»
Yuchen Jin@Yuchenj_UW
Quan điểmĐiểm AI 23/100

Cùng sự kiệnKết quả benchmark khó hiểu của Opus 5.5 gây xôn xao

Most bizarre benchmark result lol. Stick with Opus 5.5 med, folks.

DịchKết quả kiểm thử hiệu năng của Opus 5.5 đang gây ra nhiều tranh cãi và tiếng cười trong cộng đồng. Người dùng được khuyến nghị nên cân nhắc sử dụng phiên bản Opus 5.5 med thay vì các bản khác.

Cùng sự kiện, tinh chọn hiển thị «Claude Code cập nhật v2.1.280: Ra mắt Claude Opus 5.5 làm mô hình mặc định»

22/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 68/100

Cùng sự kiệnGrok 4.7 ra mắt: Hiệu suất vượt trội trên Harvey Legal, điểm số Terminal-Bench tăng gấp đôi

Legal work saw one of Grok 4.7's biggest jumps. On the Harvey Legal Agent Benchmark, Grok 4.7 scor…

DịchGrok 4.7 vừa được phát hành với hiệu suất cải thiện đáng kể so với bản 4.6, đạt 19,6% trên Harvey Legal Agent Benchmark và tăng gấp đôi điểm số Terminal-Bench 4.0 mà không thay đổi giá.

Cùng sự kiện, tinh chọn hiển thị «Elon Musk: Grok 4.7 đưa xAI lên vị trí thứ 3 trong lĩnh vực lập trình AI»

21/09

Thứ Hai · 6 tin
Haider@haider1
Mô hìnhĐiểm AI 19/100

Cùng sự kiệnLộ diện kết quả benchmark ấn tượng của mô hình Grok 4.7

Grok 4.7 benchmarks

DịchNhững dữ liệu benchmark đầu tiên của Grok 4.7 vừa được chia sẻ, hé lộ hiệu năng vượt trội của thế hệ mô hình mới từ xAI.

Cùng sự kiện, tinh chọn hiển thị «Đánh giá Grok 4.7: Lọt Top 4 bảng xếp hạng trí tuệ, năng lực lập trình bứt phá mạnh mẽ»
Fireworks AI (Web)
Sản phẩmĐiểm AI 61/100

Tinh chọnFireworks AI ra mắt Specialized Intelligence Index: Chuẩn đo lường năng lực AI chuyên sâu

Fireworks AI giới thiệu Specialized Intelligence Index (SII), bộ chỉ số đánh giá hiệu suất các mô hình AI trên 7 lĩnh vực thực tế như y tế, luật, tài chính và lập trình, giúp người dùng so sánh chính xác giữa các mô hình nguồn mở và đóng.


Vì sao đáng đọc: Đây là công cụ hữu ích giúp giải quyết bài toán đánh giá AI trong các ngành dọc, thay vì chỉ dựa vào các bài test tổng quát chung chung.
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (53 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Benchmark” | AIHOT.vn