Đánh giá & So sánh
Đo lường sức mạnh mô hình: Kết quả Benchmark tranh cãi, phương pháp đánh giá và biến động bảng xếp hạng.
1.008 bài thu thập73 tinh chọncập nhật đến 28/09 01:01
- PandailyT4 · 16/09 · 09:00
Xiaomi mã nguồn mở mô hình thế giới Robotics-U0 cho robot thông minh
Xiaomi vừa công bố mã nguồn mở Robotics-U0, mô hình nền tảng thế giới tự hồi quy với quy mô lên tới 38 tỷ tham số, giúp tăng tốc độ xử lý gấp 83 lần và dẫn đầu bảng xếp hạng WorldArena về khả năng mô phỏng cảnh quan robot.
- ArenaT4 · 16/09 · 04:21
Bảng xếp hạng Image-to-WebDev cập nhật: GPT-6 Astra dẫn đầu với 1733 điểm
Arena vừa cập nhật bảng xếp hạng Image-to-WebDev với sự góp mặt của 4 mô hình mới. GPT-6 Astra (Max) xuất sắc giành vị trí quán quân với 1733 điểm, vượt xa các đối thủ như Claude Fable 5.1 và Muse Spark 1.3.
- Trail of Bits: Nghiên cứu an toàn AIT3 · 15/09 · 18:42
Trail of Bits chỉ trích báo cáo AI của 1Password là gây hiểu lầm, công bố bộ kiểm chứng mới
Trail of Bits cho rằng báo cáo của 1Password về khả năng tự sửa lỗi của AI bị sai lệch do thiết kế thử nghiệm thiếu khách quan. Họ đã công bố hai bản vá mới để đánh giá chính xác hơn năng lực thực tế của các tác nhân AI.
- WeChat: StepFun (Step)T3 · 15/09 · 14:40
StepAI ra mắt dòng mô hình âm thanh StepAudio 3: Thống trị bảng xếp hạng toàn cầu của Artificial Analysis
StepAI vừa trình làng bộ 5 mô hình StepAudio 3 bao gồm Realtime, ASR, TTS, Gen và Music, hiện đã sẵn sàng trải nghiệm trên nền tảng mở của hãng.
- Artificial AnalysisT3 · 15/09 · 10:21
GPT-Live-1 của OpenAI soán ngôi đầu bảng xếp hạng Speech-to-Speech của Artificial Analysis
Artificial Analysis vừa công bố bảng xếp hạng Speech-to-Speech, trong đó GPT-Live-1 (backend Astra) dẫn đầu với 81,5 điểm, vượt qua Grok Voice Think Fast 2.0 High để chiếm vị trí số 1.
- ArenaT3 · 15/09 · 00:51
DeepSeek-V4.1-Flash (Max) vươn lên vị trí thứ 3 trên bảng xếp hạng Agent Arena
DeepSeek-V4.1-Flash (Max) đạt vị trí thứ 3 trong nhóm mô hình mã nguồn mở trên Agent Arena với hiệu suất tăng 4,87% và chi phí tối ưu chỉ 0,07 USD mỗi tác vụ, vượt xa các đối thủ về hiệu quả kinh tế.
- QbitAIT2 · 14/09 · 11:30
Đột phá AI vật lý từ Trung Quốc: PhysBrain 1.5 dẫn đầu bảng xếp hạng mã nguồn mở toàn cầu
PhysBrain 1.5 vừa thiết lập cột mốc mới trong lĩnh vực trí tuệ không gian, khẳng định vị thế ngang hàng với các mô hình tiên tiến như GPT-6 Astra bằng cách giải quyết thành công bài toán vòng lặp vật lý phức tạp.
- OpenRouter: AnnouncementsT2 · 14/09 · 07:00
Hướng dẫn OpenRouter: Tự động đánh giá đầu ra của AI Agent bằng phương pháp LLM-as-a-judge
OpenRouter chia sẻ cách sử dụng mô hình AI làm giám khảo để chấm điểm tự động cho các phản hồi của AI Agent, giúp kiểm soát chất lượng các câu trả lời mở mà phương pháp kiểm thử truyền thống không làm được.
- Dario AmodeiCN · 13/09 · 03:43
CEO Anthropic kêu gọi làm chậm tốc độ phát triển AI và đề xuất lộ trình 3 bước
Dario Amodei, CEO của Anthropic, vừa công bố bài viết kêu gọi ngành AI cần giảm tốc độ phát triển. Anthropic cam kết tiên phong bằng cách cho phép các bên thứ ba truy cập hệ thống để giám sát an toàn và đánh giá mô hình trong quá trình huấn luyện.
- JiQiZhiXinT7 · 12/09 · 15:00
Chấn động: 25 chủ nhân giải Fields, bao gồm Terence Tao, cảnh báo AI đang hủy hoại toán học
25 nhà toán học hàng đầu thế giới đã ký tên vào bức thư ngỏ chỉ trích các công ty AI vì ưu tiên chạy đua benchmark thay vì tuân thủ quy trình nghiên cứu khoa học chuẩn mực, gây ra sự lệch lạc nghiêm trọng trong cộng đồng toán học.
- Epoch AI: Nghiên cứu, dữ liệu và đánh giáT7 · 12/09 · 07:00
Epoch AI đánh giá ExploitBench v0.1: Bộ tiêu chuẩn kiểm thử khả năng khai thác lỗ hổng V8
Epoch AI công bố đánh giá về ExploitBench v0.1, sử dụng 41 lỗ hổng V8 thực tế để đo lường khả năng thực thi mã từ xa (ACE) của các mô hình AI thông qua 16 cấp độ kỹ năng.
- Epoch AI: Nghiên cứu, dữ liệu và đánh giáT5 · 10/09 · 07:00
Đánh giá HealthBench Professional: Epoch AI chỉ ra 50% tác vụ kiểm thử bị lỗi
Epoch AI đã thực hiện kiểm định độc lập trên bộ tiêu chuẩn HealthBench Professional của OpenAI và phát hiện một nửa trong số 50 tác vụ được lấy mẫu ngẫu nhiên gặp vấn đề nghiêm trọng về chất lượng.
- OpenRouter: AnnouncementsT4 · 09/09 · 07:00
Đánh giá Seedance 2.5 từ OpenRouter: Phân tích chi phí và khả năng biên tập video chuyên sâu
OpenRouter đánh giá mô hình video Seedance 2.5 của ByteDance, nổi bật với khả năng tạo video 4-30 giây, hỗ trợ điều khiển khung hình và tích hợp âm thanh không phát sinh thêm phí.
- JiQiZhiXinT3 · 08/09 · 04:45
LLaDA-Image: Đột phá mô hình tạo ảnh từ văn bản không cần tiền huấn luyện cặp ảnh-chữ
LLaDA-Image là mô hình Diffusion Transformer 6B mới, ưu tiên học cấu trúc hình ảnh trước khi thực hiện căn chỉnh ngôn ngữ, giúp đạt hiệu suất dẫn đầu trên bảng xếp hạng Qwen-Image-Bench.
- Hugging Face Daily PapersT2 · 07/09 · 14:15
τ^τ-Bench: Thước đo thực tế cho khả năng xây dựng AI Agent từ đầu đến cuối
τ^τ-Bench là bộ tiêu chuẩn mới đánh giá khả năng của AI trong việc tự xây dựng các Agent thực tế, dựa trên các điều kiện khắt khe như dữ liệu doanh nghiệp, API sản xuất và giới hạn chi phí, thay vì chỉ giải quyết các bài toán lý thuyết.
- JiQiZhiXinCN · 06/09 · 22:15
Đội ngũ 12 tiến sĩ và 1 chủ nhân giải Fields đứng sau 'ngựa ô' AI Mostik
Startup Nga Mostik gây sốt khi leo lên top đầu bảng xếp hạng ARC-AGI-3 nhờ kỹ thuật 'cầu nối' cho phép các mô hình AI giao tiếp trực tiếp qua không gian toán học thay vì văn bản, giúp tối ưu hiệu suất vượt trội.
- IT HomeCN · 06/09 · 14:31
Fortune: OpenAI nhiều lần chỉnh sửa dữ liệu benchmark của GPT-6 Astra
Theo Fortune, OpenAI đã liên tục thay đổi số liệu đánh giá GPT-6 Astra kể từ khi công bố, bao gồm việc điều chỉnh tỷ lệ ảo tưởng từ 4,2% xuống 2% rồi lại thay đổi ngược lại, làm dấy lên nghi vấn về tính minh bạch.
- Testing CatalogCN · 06/09 · 04:59
GPT-6 Astra soán ngôi đầu bảng xếp hạng lập trình web, bỏ xa Claude Fable 5.1
GPT-6 Astra (Max) vừa vươn lên dẫn đầu bảng xếp hạng Code Arena: WebDev với 1797 điểm, vượt qua đối thủ Claude Fable 5.1 tới 35 điểm.
- Don't Worry About the Vase (Zvi)T6 · 04/09 · 23:15
Giải mã Claude Fable 5.1 và Mythos 5.1: Đánh giá chi tiết từ tài liệu hệ thống
Tại thời điểm ra mắt, Claude Fable 5.1 được đánh giá là mô hình AI mạnh mẽ nhất thế giới hiện nay. Bài viết phân tích sâu về khả năng và các thông số kỹ thuật từ tài liệu hệ thống của mô hình này.
- The Decoder: AI NewsT6 · 04/09 · 18:32
Tranh cãi về hiệu năng GPT-6 Astra: Bước tiến đột phá hay chỉ là con số ảo?
Kết quả đánh giá GPT-6 Astra gây tranh cãi khi các tổ chức đưa ra con số trái ngược. Tuy nhiên, khả năng giải quyết bài toán ARC-AGI-3 vượt xa con người của mô hình này đang khiến giới chuyên gia phải cân nhắc lại dự báo về thời điểm AGI xuất hiện.