24/09

Thứ Năm · 2 tin
Arena@arena
Mô hìnhĐiểm AI 79/100

Đã có đại diệnClaude Opus 5.5 chính thức soán ngôi đầu bảng Code Arena: WebDev với 1818 điểm

Big news: Claude Opus 5.5 (Max) by @AnthropicAI just topped #1 in Code Arena: WebDev with 1818 pts a…

DịchClaude Opus 5.5 (Max) vừa thiết lập kỷ lục mới tại bảng xếp hạng Code Arena: WebDev với 1818 điểm, vượt xa GPT-6 Astra (Max) và cải thiện đáng kể so với phiên bản tiền nhiệm.

Cùng sự kiện, tinh chọn hiển thị «Anthropic giải mã lý do Claude Opus 5.5 là lựa chọn tối ưu cho lập trình với ngữ cảnh dài»
Arena@arena
Hướng dẫnĐiểm AI 75/100

Đã có đại diệnGPT-6 Sol (Max) đạt hạng 4 trên bảng xếp hạng Code Arena: WebDev với 1689 điểm

Real-world results are in for GPT-6 Sol (Max) by @OpenAI. It landed #4 in the Code Arena: WebDev wit…

DịchOpenAI vừa công bố kết quả thực tế của GPT-6 Sol (Max) trên Code Arena: WebDev với 1689 điểm, xếp thứ 4 toàn cầu. Mức giá sử dụng được ấn định là 8 USD cho mỗi triệu token (tổng hợp đầu vào/đầu ra).

Cùng sự kiện, tinh chọn hiển thị «Arena ra mắt thử nghiệm GPT-6 Sol và GPT-6 Luna, chuẩn bị công bố bảng xếp hạng»

21/09

Thứ Hai · 1 tin

12/09

Thứ Bảy · 1 tin
Thariq@trq212
NgànhĐiểm AI 41/100

Các bài kiểm tra đánh giá AI hiện nay đang quá khắt khe và thiếu thực tế

it's basically impossible to interpret evals by looking at just at the pass/fail scores these days …

DịchCác bộ tiêu chuẩn đánh giá AI đang trở nên quá cứng nhắc với những bài kiểm tra ẩn, khiến kết quả không còn phản ánh đúng năng lực thực tế của mô hình, ngay cả khi câu trả lời của AI hợp lý hơn đáp án kỳ vọng.

26/08

Thứ Tư · 1 tin

19/08

Thứ Tư · 1 tin
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Sản phẩmĐiểm AI 32/100

Scale AI ra mắt bộ tiêu chuẩn RSI: Bước tiến mới trong đo lường khả năng tự cải tiến của AI

great initiative (RSI benchmark) from @ScaleAILabs and @mhrezaeics

DịchScale AI vừa giới thiệu bộ tiêu chuẩn RSI (Recursive Self-Improvement) nhằm đo lường khả năng tự tiến hóa của các hệ thống AI, đánh dấu cột mốc quan trọng trong việc theo dõi sự phát triển của trí tuệ nhân tạo hướng tới khả năng tự nâng cấp.

Tổng 6 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (20 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI Benchmark” | AIHOT.vn