Ethan Mollick@emollick
Điểm AI 36/100

Ngành

Khi các bài kiểm tra AI đạt ngưỡng bão hòa: Chúng ta nên đo lường tiến bộ bằng gì?

(giờ Việt Nam)

Nguyên văn trên X

Now that METR long horizons is effectively saturated (Epoch found pre-Fable agents could do 18 weeks…

Dịch · tóm tắt AI

Khi các chuẩn đo lường như METR, Frontier Math và ARC-AGI dần trở nên quá dễ dàng với AI, giới chuyên gia đang đặt câu hỏi về các chỉ số mới để đánh giá tốc độ phát triển thực sự của trí tuệ nhân tạo.

Bài viết được AI dịch và tổng hợp tự động từ X: Ethan Mollick (@emollick). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Khi các bài kiểm tra AI đạt ngưỡng bão hòa: Chúng ta nên đo lường tiến bộ bằng gì? | AIHOT.vn