Đánh giá & So sánh
CHỦ ĐỀ · TRANG 4

Đánh giá & So sánh

Đo lường sức mạnh mô hình: Kết quả Benchmark tranh cãi, phương pháp đánh giá và biến động bảng xếp hạng.

1.009 bài thu thập73 tinh chọncập nhật đến 28/09 01:01

  1. WeChat: Baidu AI Cloud (ERNIE)T4 · 19/08 · 21:17

    Baidu Qianfan tích hợp mô hình GLM-5.3 của Zhipu AI

    Baidu Qianfan vừa ra mắt mô hình mã nguồn mở GLM-5.3 với khả năng vượt trội về lập trình và bảo mật mạng, đạt điểm số ngang bằng Kimi K3 trong bảng xếp hạng AA.

  2. HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)T4 · 19/08 · 10:05

    StartupBench: Bộ tiêu chuẩn đánh giá AI Agent dựa trên quy trình thực tế của startup

    StartupBench là bộ tiêu chuẩn đánh giá AI Agent thông qua các quy trình làm việc thực tế từ các startup, thay vì các tác vụ giả định. Kết quả cho thấy ngay cả những mô hình mạnh nhất cũng chỉ đạt tỷ lệ thành công 30%, bộc lộ hạn chế lớn trong việc tuân thủ chỉ dẫn phức tạp và kiến thức chuyên môn.

  3. JiQiZhiXinT3 · 18/08 · 23:00

    Kỷ nguyên Harness trong đánh giá AI: 15 tổ chức học thuật ra mắt HarnessEval

    HarnessEval định nghĩa lại cách đánh giá các hệ thống AI phức tạp bằng cách xây dựng một quy trình kiểm chứng có hệ thống, thay vì chỉ dựa vào các mô hình chấm điểm đơn thuần.

  4. Hugging Face Daily PapersT3 · 18/08 · 16:00

    Tại sao các AI tự động nghiên cứu khoa học lại thất bại? Đánh giá toàn diện trên 100 tác vụ thực tế

    Nghiên cứu giới thiệu AutoResearchEval, bộ dữ liệu gồm 100 tác vụ khoa học thực tế để phân tích quy trình và các điểm yếu của AI trong toàn bộ vòng đời nghiên cứu, từ lên ý tưởng đến viết báo cáo.

  5. Google AI: DEV tác giảT3 · 18/08 · 14:36

    Thiết kế đánh giá AI: Ưu tiên sự minh bạch trước khi trực quan hóa dữ liệu

    Bài viết hướng dẫn cách sử dụng các framework mã nguồn mở như Inspect AI và Harbor để đánh giá kỹ năng của AI Agent, kết hợp cùng Google Sheets và Data Studio để phân tích kết quả trực quan.

  6. JiQiZhiXinT2 · 17/08 · 15:00

    HiDream-O1-World ra mắt: Mô hình thế giới tương tác toàn năng, dẫn đầu bảng xếp hạng WBench

    HiDream.ai vừa trình làng HiDream-O1-World, mô hình thế giới tương tác đầu tiên sử dụng kiến trúc UiT, cho phép người dùng tự do khám phá và thay đổi môi trường ảo với độ nhất quán vật lý cực cao.

  7. QbitAIT7 · 15/08 · 14:45

    Qwen2.5-27B: Chạy Agent 'đẳng cấp Opus' chỉ với card đồ họa phổ thông

    Mô hình Qwen2.5-27B mới vừa thiết lập cột mốc ấn tượng khi vượt mặt Claude trên nhiều bảng xếp hạng, cho phép người dùng cá nhân chạy các tác nhân AI mạnh mẽ ngay trên GPU tiêu dùng.

  8. PandailyT6 · 14/08 · 15:15

    Luna-TTS của VUI Labs: 'Ngôi sao' AI Trung Quốc vượt mặt ElevenLabs trên bảng xếp hạng toàn cầu

    Startup VUI Labs vừa đưa mô hình Luna-TTS lên vị trí dẫn đầu bảng xếp hạng TTS Arena của Hugging Face, vượt qua các tên tuổi lớn như ElevenLabs nhờ kiến trúc khuếch tán từ Qwen3 và độ trễ cực thấp chỉ 41,6ms.

  9. JiQiZhiXinT6 · 14/08 · 14:45

    Bước ngoặt của AI Agent: Bảng xếp hạng AML ra mắt, định nghĩa lại khả năng ghi nhớ dài hạn

    Bảng xếp hạng Agent Memory Leaderboard (AML) chính thức công bố kết quả đầu tiên, đánh dấu bước tiến quan trọng trong việc giải quyết bài toán bộ nhớ dài hạn cho AI Agent, giúp chúng thoát khỏi tình trạng 'quên sạch' sau mỗi phiên làm việc.

  10. Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web)T6 · 14/08 · 13:00

    GLM-5.3 ra mắt: Đứng đầu bảng xếp hạng mã nguồn mở về khả năng lập trình và bảo mật

    Zhipu AI vừa trình làng GLM-5.3 với hiệu suất lập trình tăng 50%, dẫn đầu các mô hình mã nguồn mở trên Terminal Bench 3.0. Ngoài ra, mô hình còn thể hiện năng lực vượt trội trong kiểm thử bảo mật và phân tích mã nguồn.

  11. Cursor BlogT5 · 13/08 · 01:23

    Cursor hợp tác cùng SpaceXAI ra mắt Grok 4.6: Bước tiến mới trong lập trình AI

    Cursor và SpaceXAI vừa trình làng Grok 4.6, tập trung tối ưu hóa các tác vụ lập trình phức tạp và xử lý hình ảnh tương tác, đạt hiệu suất ngang ngửa GPT-5.6 Sol trên bảng xếp hạng Artificial Analysis.

  12. OpenRouter: AnnouncementsT4 · 12/08 · 22:45

    OpenRouter ra mắt chuẩn đánh giá tìm kiếm web thời gian thực cho AI Agent

    OpenRouter công bố bảng xếp hạng hiệu suất tìm kiếm, cho thấy việc tăng độ sâu tìm kiếm giúp cải thiện đáng kể kết quả, đồng thời khẳng định chọn đúng mô hình quan trọng hơn công cụ tìm kiếm.

  13. JiQiZhiXinT4 · 12/08 · 10:45

    Bài kiểm tra 'tối hậu thư' cho AI: MLS-Bench vạch trần khả năng nghiên cứu thực sự của các mô hình lớn

    Nhóm nghiên cứu từ các đại học danh tiếng giới thiệu MLS-Bench, bộ tiêu chuẩn mới nhằm phân biệt giữa việc AI thực sự khám phá phương pháp khoa học mới hay chỉ là tối ưu hóa kỹ thuật đơn thuần.

Đánh giá & So sánh — Chủ Đề AI · Trang 4 | AIHOT.vn