26/09

Thứ Bảy · 2 tin
Arena@arena
Nghiên cứuĐiểm AI 67/100

Đã có đại diệnGPT-6 Sol (Max) thiết lập chuẩn mực mới trên Agent Arena với hiệu suất tăng 7,7%

GPT-6 Sol (Max) by @OpenAI has reshaped the Agent Arena Pareto frontier with a +7.7% net improvement…

DịchOpenAI vừa đưa GPT-6 Sol (Max) vào bảng xếp hạng Agent Arena. Mô hình này đạt mức cải thiện ròng 7,7% dựa trên hơn 4.000 phiên hội thoại thực tế, xếp hạng 6 với chi phí trung bình 0,75 USD mỗi tác vụ.

Cùng sự kiện, tinh chọn hiển thị «Arena ra mắt thử nghiệm GPT-6 Sol và GPT-6 Luna, chuẩn bị công bố bảng xếp hạng»
Arena@arena
Mô hìnhĐiểm AI 81/100

Cùng sự kiệnGPT-6 Sol (Max) chính thức góp mặt trong bảng xếp hạng Agent Arena ở vị trí thứ 6 với mức cải thiện 7,7%

GPT-6 Sol (Max) just landed in the Agent Arena with +7.7% net-improvement at #6 across 4K+ real-worl…

DịchOpenAI vừa ra mắt GPT-6 Sol và GPT-6 Luna. Trong đó, phiên bản GPT-6 Sol (Max) đã nhanh chóng đạt vị trí thứ 6 trên bảng xếp hạng Agent Arena, ghi nhận mức tăng trưởng hiệu suất 7,7% qua hơn 4.000 phiên hội thoại thực tế.

Cùng sự kiện, tinh chọn hiển thị «Arena ra mắt thử nghiệm GPT-6 Sol và GPT-6 Luna, chuẩn bị công bố bảng xếp hạng»

25/09

Thứ Sáu · 1 tin
Arena@arena
Hướng dẫnĐiểm AI 55/100

Cùng sự kiệnGrok 4.7 (xHigh) chính thức góp mặt trong top 16 bảng xếp hạng Agent Arena

Grok 4.7 by @SpaceXAI just landed in Agent Arena at #16, with a net improvement score of +3.96% Gro…

DịchMô hình Grok 4.7 (xHigh) vừa ghi dấu ấn tại vị trí thứ 16 trên bảng xếp hạng Agent Arena với mức cải thiện điểm số ấn tượng là +3,96%.

Cùng sự kiện, bài đại diện «Grok 4.7: Mô hình nhỏ nhưng hiệu năng ấn tượng với chi phí tối ưu»

23/09

Thứ Tư · 1 tin
Arena@arena
NgànhĐiểm AI 72/100

Đã có đại diệnClaude Opus 5.5 chính thức góp mặt tại Agent Arena và chế độ Battle Mode

Claude Opus 5.5 by @AnthropicAI is now in the Agent Arena! Your votes drive the @arena leaderboards…

DịchAnthropic vừa đưa Claude Opus 5.5 vào Agent Arena, cho phép người dùng đánh giá khả năng thực hiện các tác vụ phức tạp như duyệt web và sử dụng công cụ thông qua hệ thống xếp hạng dựa trên bình chọn.

Cùng sự kiện, tinh chọn hiển thị «Anthropic giải mã lý do Claude Opus 5.5 là lựa chọn tối ưu cho lập trình với ngữ cảnh dài»

22/09

Thứ Ba · 1 tin
Arena@arena
Mô hìnhĐiểm AI 54/100

Cùng sự kiệnGrok 4.7 ra mắt trên Agent Arena, khởi động bình chọn dự đoán hiệu năng

Grok 4.7 by @SpaceXAI just dropped. Looking at how past Grok versions have trended on Agent Arena's …

DịchGrok 4.7 chính thức gia nhập Agent Arena với 4 chế độ thử thách chuyên biệt. Nền tảng này sử dụng hàng triệu tác vụ thực tế để đánh giá khả năng của AI, đồng thời tổ chức bình chọn cộng đồng để dự đoán mức độ cải thiện của phiên bản mới.

Cùng sự kiện, tinh chọn hiển thị «Elon Musk: Grok 4.7 đưa xAI lên vị trí thứ 3 trong lĩnh vực lập trình AI»

21/09

Thứ Hai · 2 tin
Arena@arena
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnGrok 4.7 chính thức gia nhập bảng xếp hạng Agent Arena

Grok 4.7 by @SpaceXAI and @elonmusk is now in the Agent Arena! Your votes drive the @arena leaderbo…

DịchxAI vừa đưa Grok 4.7 vào Agent Arena để đánh giá khả năng thực thi các tác vụ phức tạp thông qua công cụ. Phiên bản này cho thấy hiệu suất vượt trội so với Grok 4.6 trong các bài kiểm tra về lập trình, xử lý văn bản và thị giác.

Cùng sự kiện, tinh chọn hiển thị «Đánh giá Grok 4.7: Lọt Top 4 bảng xếp hạng trí tuệ, năng lực lập trình bứt phá mạnh mẽ»
Arena@arena
Quan điểmĐiểm AI 44/100

Agent Arena phân tích 20.840 phản hồi lập trình từ 29 mô hình AI

What can user praise and complaints tell us about coding agents themselves? We analyzed 20, 840 trac…

DịchDựa trên dữ liệu từ 20.840 lượt truy vết, Agent Arena cho thấy các mô hình tiên tiến nhận được phản hồi tích cực vượt trội, đồng thời các mô hình mới ra mắt cũng đang dần cải thiện hiệu suất lập trình.

15/09

Thứ Ba · 2 tin
Arena@arena
Hướng dẫnĐiểm AI 58/100

DeepSeek-V4.1-Flash (Max) lọt Top 3 mô hình nguồn mở trên Agent Arena với chi phí cực rẻ

DeepSeek-V4.1-Flash (Max) is a breakthrough in performance to cost efficiency. With +4.87% net impro…

DịchDeepSeek-V4.1-Flash (Max) vừa ghi danh vào bảng xếp hạng Agent Arena, đạt vị trí thứ 3 trong nhóm mô hình nguồn mở với chi phí chỉ 0,07 USD mỗi tác vụ, thiết lập chuẩn mực mới về hiệu suất trên chi phí.

Arena@arena
Nghiên cứuĐiểm AI 66/100

Tinh chọnDeepSeek-V4.1-Flash (Max) vươn lên vị trí thứ 3 trên bảng xếp hạng Agent Arena

Exciting news: DeepSeek-V4.1-Flash (Max) by @deepseek_ai just landed in Agent Arena at #3 among open…

DịchDeepSeek-V4.1-Flash (Max) đạt vị trí thứ 3 trong nhóm mô hình mã nguồn mở trên Agent Arena với hiệu suất tăng 4,87% và chi phí tối ưu chỉ 0,07 USD mỗi tác vụ, vượt xa các đối thủ về hiệu quả kinh tế.


Vì sao đáng đọc: Tin tức quan trọng về hiệu suất và tối ưu chi phí của mô hình DeepSeek, thu hút sự quan tâm lớn từ cộng đồng AI và các nhà phát triển ứng dụng Agent.
Tổng 9 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (26 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Agent Arena” | AIHOT.vn