GPT-6 Sol (Max) by @OpenAI has reshaped the Agent Arena Pareto frontier with a +7.7% net improvement…
DịchOpenAI vừa đưa GPT-6 Sol (Max) vào bảng xếp hạng Agent Arena. Mô hình này đạt mức cải thiện ròng 7,7% dựa trên hơn 4.000 phiên hội thoại thực tế, xếp hạng 6 với chi phí trung bình 0,75 USD mỗi tác vụ.
GPT-6 Sol (Max) just landed in the Agent Arena with +7.7% net-improvement at #6 across 4K+ real-worl…
DịchOpenAI vừa ra mắt GPT-6 Sol và GPT-6 Luna. Trong đó, phiên bản GPT-6 Sol (Max) đã nhanh chóng đạt vị trí thứ 6 trên bảng xếp hạng Agent Arena, ghi nhận mức tăng trưởng hiệu suất 7,7% qua hơn 4.000 phiên hội thoại thực tế.
Claude Opus 5.5 by @AnthropicAI is now in the Agent Arena! Your votes drive the @arena leaderboards…
DịchAnthropic vừa đưa Claude Opus 5.5 vào Agent Arena, cho phép người dùng đánh giá khả năng thực hiện các tác vụ phức tạp như duyệt web và sử dụng công cụ thông qua hệ thống xếp hạng dựa trên bình chọn.
Grok 4.7 by @SpaceXAI just dropped. Looking at how past Grok versions have trended on Agent Arena's …
DịchGrok 4.7 chính thức gia nhập Agent Arena với 4 chế độ thử thách chuyên biệt. Nền tảng này sử dụng hàng triệu tác vụ thực tế để đánh giá khả năng của AI, đồng thời tổ chức bình chọn cộng đồng để dự đoán mức độ cải thiện của phiên bản mới.
Grok 4.7 by @SpaceXAI and @elonmusk is now in the Agent Arena! Your votes drive the @arena leaderbo…
DịchxAI vừa đưa Grok 4.7 vào Agent Arena để đánh giá khả năng thực thi các tác vụ phức tạp thông qua công cụ. Phiên bản này cho thấy hiệu suất vượt trội so với Grok 4.6 trong các bài kiểm tra về lập trình, xử lý văn bản và thị giác.
What can user praise and complaints tell us about coding agents themselves? We analyzed 20, 840 trac…
DịchDựa trên dữ liệu từ 20.840 lượt truy vết, Agent Arena cho thấy các mô hình tiên tiến nhận được phản hồi tích cực vượt trội, đồng thời các mô hình mới ra mắt cũng đang dần cải thiện hiệu suất lập trình.
DeepSeek-V4.1-Flash (Max) is a breakthrough in performance to cost efficiency. With +4.87% net impro…
DịchDeepSeek-V4.1-Flash (Max) vừa ghi danh vào bảng xếp hạng Agent Arena, đạt vị trí thứ 3 trong nhóm mô hình nguồn mở với chi phí chỉ 0,07 USD mỗi tác vụ, thiết lập chuẩn mực mới về hiệu suất trên chi phí.
Exciting news: DeepSeek-V4.1-Flash (Max) by @deepseek_ai just landed in Agent Arena at #3 among open…
DịchDeepSeek-V4.1-Flash (Max) đạt vị trí thứ 3 trong nhóm mô hình mã nguồn mở trên Agent Arena với hiệu suất tăng 4,87% và chi phí tối ưu chỉ 0,07 USD mỗi tác vụ, vượt xa các đối thủ về hiệu quả kinh tế.
Vì sao đáng đọc: Tin tức quan trọng về hiệu suất và tối ưu chi phí của mô hình DeepSeek, thu hút sự quan tâm lớn từ cộng đồng AI và các nhà phát triển ứng dụng Agent.
Tổng 9 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (26 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả