28/08

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 58/100

PAWBench: Đánh giá khả năng mô phỏng thế giới thực của các mô hình tạo video

PAWBench là bộ tiêu chuẩn mới giúp kiểm tra xem các mô hình tạo video có thể tái tạo chính xác phân phối xác suất của hành vi vật lý hay không, thay vì chỉ tạo ra các video đơn lẻ hợp lý. Kết quả cho thấy các mô hình hiện nay vẫn chưa đạt được độ chính xác cần thiết.

27/08

Thứ Năm · 4 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 41/100

Kỹ năng của LLM có thay đổi theo ngôn ngữ? Nghiên cứu về tính nhất quán đa ngôn ngữ

Nghiên cứu mới sử dụng khung tự đối kháng đa ngôn ngữ để chỉ ra rằng LLM thể hiện trình độ tư duy và chiến lược khác biệt đáng kể tùy theo ngôn ngữ sử dụng, đặt ra thách thức lớn cho việc phát triển các mô hình đa ngôn ngữ thực thụ.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

MemUse: Đánh giá bộ nhớ AI qua hội thoại tự nhiên thay vì chỉ hỏi đáp trực tiếp

Nghiên cứu chỉ ra rằng khả năng trả lời câu hỏi trực tiếp không phản ánh đúng sự hài lòng của người dùng. MemUse đề xuất phương pháp đánh giá mới dựa trên cách AI tích hợp ngữ cảnh quá khứ một cách tự nhiên vào hội thoại.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 60/100

Cùng sự kiệnĐánh giá GLM-5.3-Flash: Hiệu năng vượt trội và chi phí tối ưu

GLM-5.3-Flash đạt 57 điểm trên Artificial Analysis, vượt xa mức trung bình 18 của các mô hình cùng phân khúc. Với cửa sổ ngữ cảnh 400k tokens và khả năng xử lý đa phương thức, đây là lựa chọn đáng chú ý về hiệu năng và giá thành.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»

26/08

Thứ Tư · 2 tin
Testing Catalog@testingcatalog
Hướng dẫnĐiểm AI 34/100

Glean phân tích hiệu quả chi phí của 37 mô hình AI trong tác vụ doanh nghiệp

Glean has published a Pareto frontier analysis of 37 models and reasoning configurations across 1, 00…

DịchGlean đã đánh giá 37 mô hình AI qua 1.000 tác vụ doanh nghiệp, phát hiện sự chênh lệch chi phí lên tới 36 lần nhưng chất lượng chỉ cải thiện 22%, giúp doanh nghiệp tối ưu hóa lựa chọn mô hình.

25/08

Thứ Ba · 3 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

MobilePA-Bench: Bộ tiêu chuẩn đánh giá tác nhân AI trên thiết bị di động với các tác vụ thực tế phức tạp

MobilePA-Bench là bộ tiêu chuẩn tương tác mới giúp đánh giá khả năng lập kế hoạch và sử dụng công cụ của các tác nhân AI trên di động thông qua 212 công cụ thực tế. Kết quả cho thấy các mô hình ngôn ngữ lớn hiện nay vẫn gặp khó khăn khi xử lý các ràng buộc phức tạp và lỗi vận hành.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 48/100

Task-CoEvolve: Tối ưu hóa Harness hiệu quả thông qua chọn lọc tác vụ thích ứng

Task-CoEvolve giới thiệu phương pháp tối ưu hóa harness cho LLM bằng cách cho phép các tác vụ kiểm chứng cùng tiến hóa, giúp giảm 80% chi phí đánh giá mà vẫn duy trì độ chính xác tương đương với bộ dữ liệu đầy đủ.

Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 35/100

Mô hình Qwen2.5 27B hiện đã hỗ trợ kiểm thử hiệu năng trên nền tảng Optima

You can now benchmark Qwen3.8 27B with Optima. See how a model that can run on your laptop compares …

DịchBạn có thể sử dụng Optima để đánh giá hiệu suất, chi phí và tốc độ của mô hình Qwen2.5 27B trên các tác vụ thực tế ngay trên máy tính cá nhân. Artificial Analysis cũng cung cấp hỗ trợ tư vấn và tín dụng miễn phí cho các doanh nghiệp muốn xây dựng bộ kiểm thử riêng.

24/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

FlavourBench: Đánh giá mô hình ngôn ngữ thông qua khả năng phối hợp nguyên liệu ẩm thực

FlavourBench là bộ tiêu chuẩn đánh giá tự động mới, sử dụng hệ thống ẩm thực có thể thực thi để đo lường khả năng tư duy logic và sáng tạo của 27 mô hình ngôn ngữ lớn thông qua các bài toán phối hợp nguyên liệu.

23/08

Chủ Nhật · 2 tin

21/08

Thứ Sáu · 3 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

Vạch trần lỗ hổng: Các mô hình ASR hàng đầu đang 'học vẹt' để đạt điểm chuẩn cao

Nghiên cứu mới chỉ ra rằng các mô hình ASR hàng đầu có xu hướng 'học vẹt' văn bản tham chiếu thay vì thực sự hiểu âm thanh, dẫn đến điểm số ảo dù dữ liệu đầu vào bị nhiễu hoặc thiếu hụt.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 57/100

MemTrapBench: Bộ tiêu chuẩn mới đánh giá 'bẫy nhận thức' trong trí nhớ của LLM

MemTrapBench giải quyết lỗ hổng trong việc đánh giá cách bộ nhớ làm sai lệch khả năng suy luận của LLM. Nghiên cứu chỉ ra rằng các phương pháp ghi nhớ hiện tại thường gây tác dụng ngược, đồng thời giới thiệu AdaptiveMem giúp tối ưu hóa hiệu suất mà không mắc phải các bẫy nhận thức này.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 42/100

Nghiên cứu mới: Hiệu suất của AI tự cải tiến dựa trên bộ nhớ có thể chỉ là 'nhiễu' đánh giá

Finally a good paper testing whether memory-based self-improving agents actually improve. The re-ev…

DịchNghiên cứu chỉ ra rằng sự cải thiện của các tác nhân AI dựa trên bộ nhớ chủ yếu đến từ thứ tự nhiệm vụ và nhiễu đánh giá thay vì khả năng tự học thực sự. Khi kiểm soát các yếu tố này, hiệu suất của mô hình giảm đáng kể, đặt ra dấu hỏi về tính hiệu quả của các phương pháp hiện tại.

20/08

Thứ Năm · 2 tin
Nathan Lambert@natolambert
Hướng dẫnĐiểm AI 36/100

RAM Score: Thước đo mới đánh giá sức hút của các mô hình AI trên HuggingFace

I think the RAM score @xeophon and I made for ATOM work is a really solid metric. If I just rank by …

DịchRAM Score là chỉ số mới giúp đo lường hiệu suất tải xuống của các mô hình AI dựa trên tỷ lệ so sánh với top 10 mô hình cùng phân khúc. Đây là công cụ hữu ích để nhận diện các mô hình tiềm năng, đặc biệt là với các dòng có quy mô từ 50 tỷ tham số trở lên.

19/08

Thứ Tư · 4 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 36/100

Thử nghiệm lập trình 3D: DeepSeek-V4-Pro tiêu tốn lượng token gấp 48 lần Muse

This 3D coding test by @thehypedotnews found DeepSeek-V4-Pro-0813 used 48X more tokens than Muse Spa…

DịchTrong thử nghiệm xây dựng 3D, DeepSeek-V4-Pro-0813 tiêu tốn hơn 20 triệu token, gấp 48 lần so với Muse Spark 1.2, với chi phí 4,57 USD và thời gian xử lý hơn 91 phút.

18/08

Thứ Ba · 4 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Sản phẩmĐiểm AI 46/100

Prior Labs ra mắt bộ công cụ mã nguồn mở RelArena-α, TabPFN-Rel và RPI cho học máy quan hệ

Prior Labs giới thiệu hệ sinh thái mã nguồn mở gồm RelArena-α (khung đánh giá), TabPFN-Rel (mô hình hiệu suất cao) và RPI (giao diện linh hoạt) nhằm chuẩn hóa và thúc đẩy nghiên cứu trong lĩnh vực học máy quan hệ.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

TRACE-Bench: Giải mã và đánh giá khả năng tạo ảnh từ nhiều ảnh tham chiếu

TRACE-Bench phân tách quá trình tạo ảnh từ nhiều tham chiếu thành 4 thao tác cơ bản, giúp chỉ ra rằng các mô hình AI hiện nay vẫn gặp khó khăn lớn trong việc tách biệt và gán thuộc tính chính xác.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 49/100

R^3-Bench: Thử thách khả năng suy luận của LLM trong môi trường giới hạn tài nguyên

R^3-Bench là bộ tiêu chuẩn mới đánh giá khả năng suy luận toán học và lập trình của LLM khi phải phân bổ tài nguyên hạn chế. Kết quả cho thấy các mô hình hiện nay vẫn gặp khó khăn trong việc tối ưu hóa chiến lược giải quyết vấn đề dưới áp lực ngân sách tài nguyên.

17/08

Thứ Hai · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

HumanTracker: Bước tiến mới trong đánh giá chuyển động robot hình người chuẩn xác theo cảm nhận con người

HumanTracker giới thiệu bộ dữ liệu quy mô lớn và thước đo HumanScore giúp đánh giá chuyển động robot hình người sát với cảm nhận thực tế, khắc phục các lỗi vật lý như trượt chân hay tiếp đất sai thời điểm mà các phương pháp cũ thường bỏ qua.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Vượt xa điểm số: Đánh giá hệ thống các tác nhân AI trong nghiên cứu và phát triển dài hạn

Nghiên cứu đề xuất khung đánh giá mới để phân tích hành vi của các tác nhân AI trong các nhiệm vụ dài hạn, thay vì chỉ dựa vào kết quả cuối cùng. Kết quả cho thấy các mô hình hiện nay hoạt động giống công cụ tối ưu hóa kỹ thuật hơn là những nhà nghiên cứu tự chủ thực thụ.

WeChat: Khazix
Hướng dẫnĐiểm AI 53/100

Sự thật về AI Agent: Tỷ lệ thành công trong công việc thực tế vẫn thấp đáng báo động

Đánh giá RealReplicaBench từ Alibaba cho thấy các mô hình AI hàng đầu như Claude Opus 5 hay Qwen 3.8 Max đều có tỷ lệ hoàn thành nhiệm vụ thương mại điện tử thực tế dưới 60%, cho thấy khoảng cách lớn giữa lý thuyết và ứng dụng.

14/08

Thứ Sáu · 3 tin
OpenRouter@OpenRouter
Sản phẩmĐiểm AI 50/100

Cùng sự kiệnOpenRouter ra mắt bộ tiêu chuẩn đánh giá khả năng tìm kiếm web cho AI

Introducing Web Search Benchmarks 🌐 Rankings of search tools across different models and configura…

DịchOpenRouter vừa công bố bộ tiêu chuẩn đánh giá hiệu suất của các mô hình AI khi thực hiện tìm kiếm web, giúp người dùng lựa chọn công cụ tối ưu để cung cấp dữ liệu thực tế cho các tác nhân AI (AI agents).

Cùng sự kiện, tinh chọn hiển thị «OpenRouter ra mắt chuẩn đánh giá tìm kiếm web thời gian thực cho AI Agent»
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 37/100

Harness-IF: Phương pháp định lượng mức độ tuân thủ quy tắc của AI Agent

If you write rules in an AGENTS.md, this one is worth your time. When a coding agent follows your r…

DịchHarness-IF đánh giá khả năng tuân thủ các quy tắc trong AGENTS.md của AI Agent bằng cách loại bỏ các yếu tố ngẫu nhiên. Kết quả cho thấy độ chính xác thực tế thấp hơn dự đoán, đồng thời khẳng định hệ thống và chỉ dẫn người dùng luôn được ưu tiên hơn mô tả công cụ.

13/08

Thứ Năm · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Ảo tưởng về công cụ thị giác: Đánh giá nhân quả khả năng 'tư duy bằng hình ảnh' của LLM

Nghiên cứu chỉ ra rằng các thao tác thị giác như cắt/phóng ảnh trong LLM đa phương thức thường không cải thiện hiệu suất đáng kể mà lại gây tốn kém tài nguyên. Tác giả đề xuất mô hình đồ thị nhân quả để kiểm chứng liệu các công cụ này có thực sự hỗ trợ tư duy hay chỉ là sự ngẫu nhiên.

karminski@karminski3
Hướng dẫnĐiểm AI 45/100

DeepSeek-V4-Pro-0813 gây tranh cãi vì tự ý dừng sớm trong các tác vụ dài

DeepSeek-V4-Pro-0813 bị phát hiện tự dừng sớm khi thực hiện các tác vụ lập trình phức tạp, dù chưa hoàn thành hết số vòng lặp cho phép. Tác giả nghi ngờ nguyên nhân nằm ở cơ chế phần thưởng RL hoặc sự suy giảm chú ý trong cửa sổ ngữ cảnh.

12/08

Thứ Tư · 4 tin
OpenRouter: Announcements
Sản phẩmĐiểm AI 67/100

Tinh chọnOpenRouter ra mắt chuẩn đánh giá tìm kiếm web thời gian thực cho AI Agent

OpenRouter công bố bảng xếp hạng hiệu suất tìm kiếm, cho thấy việc tăng độ sâu tìm kiếm giúp cải thiện đáng kể kết quả, đồng thời khẳng định chọn đúng mô hình quan trọng hơn công cụ tìm kiếm.

Thêm 2 nguồn khác đưa tinX: OpenRouter (@OpenRouter)X: Aravind Srinivas (Perplexity CEO) (@AravSrinivas)

Vì sao đáng đọc: Thông tin thực tế, có dữ liệu định lượng cụ thể giúp người dùng tối ưu hóa chi phí và hiệu quả khi xây dựng AI Agent.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Decoding-Level Taboo: Kiểm tra khả năng chịu tải của LLM bằng phương pháp can thiệp logit

Nghiên cứu giới thiệu bài kiểm tra 'Taboo' giúp đánh giá độ bền của LLM bằng cách ép mô hình đi chệch khỏi lộ trình tạo văn bản thông thường, từ đó bộc lộ những hạn chế thực tế mà các bài benchmark truyền thống thường bỏ qua.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

JigShape: Thử thách khả năng tư duy hình học của các mô hình đa phương thức qua trò chơi ghép hình

Nghiên cứu giới thiệu JigShape, bộ dữ liệu ghép hình phức tạp giúp đánh giá khả năng tư duy hình học của các mô hình VLM. Kết quả cho thấy ngay cả những mô hình tiên tiến nhất cũng gặp khó khăn lớn khi độ khó tăng dần, bộc lộ lỗ hổng trong khả năng suy luận không gian của AI.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnBài kiểm tra 'tối hậu thư' cho AI: MLS-Bench vạch trần khả năng nghiên cứu thực sự của các mô hình lớn

Nhóm nghiên cứu từ các đại học danh tiếng giới thiệu MLS-Bench, bộ tiêu chuẩn mới nhằm phân biệt giữa việc AI thực sự khám phá phương pháp khoa học mới hay chỉ là tối ưu hóa kỹ thuật đơn thuần.


Vì sao đáng đọc: Bài viết đi sâu vào vấn đề cốt lõi của AI trong nghiên cứu khoa học, cung cấp cái nhìn phản biện sắc bén về khả năng thực tế của các mô hình AI hiện nay.
Tổng 39 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (36 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Đánh giá mô hình” — Trang 3 | AIHOT.vn