Big news: Claude Opus 5.5 (Max) by @AnthropicAI just topped #1 in Code Arena: WebDev with 1818 pts a…
DịchClaude Opus 5.5 (Max) vừa thiết lập kỷ lục mới tại bảng xếp hạng Code Arena: WebDev với 1818 điểm, vượt xa GPT-6 Astra (Max) và cải thiện đáng kể so với phiên bản tiền nhiệm.
Real-world results are in for GPT-6 Sol (Max) by @OpenAI. It landed #4 in the Code Arena: WebDev wit…
DịchOpenAI vừa công bố kết quả thực tế của GPT-6 Sol (Max) trên Code Arena: WebDev với 1689 điểm, xếp thứ 4 toàn cầu. Mức giá sử dụng được ấn định là 8 USD cho mỗi triệu token (tổng hợp đầu vào/đầu ra).
Thay vì phụ thuộc vào các bảng xếp hạng chung chung, bài viết hướng dẫn bạn cách thiết kế bộ tiêu chuẩn đánh giá riêng dựa trên nhu cầu công việc thực tế để chọn ra mô hình AI phù hợp nhất.
it's basically impossible to interpret evals by looking at just at the pass/fail scores these days …
DịchCác bộ tiêu chuẩn đánh giá AI đang trở nên quá cứng nhắc với những bài kiểm tra ẩn, khiến kết quả không còn phản ánh đúng năng lực thực tế của mô hình, ngay cả khi câu trả lời của AI hợp lý hơn đáp án kỳ vọng.
Intel vừa tung ra bản cập nhật driver Game On mới cho dòng card đồ họa Arc và chip Core Ultra, tập trung hỗ trợ game NBA 2K27 và khắc phục các lỗi treo ứng dụng liên quan đến Geekbench AI cùng các công cụ đo lường hiệu năng khác.
great initiative (RSI benchmark) from @ScaleAILabs and @mhrezaeics
DịchScale AI vừa giới thiệu bộ tiêu chuẩn RSI (Recursive Self-Improvement) nhằm đo lường khả năng tự tiến hóa của các hệ thống AI, đánh dấu cột mốc quan trọng trong việc theo dõi sự phát triển của trí tuệ nhân tạo hướng tới khả năng tự nâng cấp.