AI Notes@AYi_AInotes
Điểm AI 42/100

Sản phẩm

DeepSeek V4 Flash tự kiểm chứng: Vượt mặt Claude Fable 5 với chi phí rẻ hơn 11 lần

(giờ Việt Nam)

Tóm tắt AI

Nhóm nghiên cứu Stanford sử dụng DeepSeek V4 Flash để tự đánh giá kết quả, giúp tăng độ chính xác trên Terminal-Bench 2.1 từ 79% lên 88%, vượt qua Claude Fable 5 với chi phí chỉ bằng 1/11. Phương pháp này chứng minh tiềm năng của việc mở rộng quy mô thời gian suy luận (test-time scaling).

Nguồn này chưa có thân bài hiển thị được, trang chỉ có tóm tắt.

Xem trên X (mở trong thẻ mới)

Bài viết được AI dịch và tổng hợp tự động từ X: AI Notes (@AYi_AInotes). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

DeepSeek V4 Flash tự kiểm chứng: Vượt mặt Claude Fable 5 với chi phí rẻ hơn 11 lần | AIHOT.vn