Rohan Paul@rohanpaul_ai
Điểm AI 47/100

Nghiên cứu

Khung BenchDrift của IBM: Cách diễn đạt khiến điểm số LLM biến động tới 74,7%

(giờ Việt Nam)

Nguyên văn trên X

A model can know the answer and still fail because you asked the same question differently. New IBM…

Dịch · tóm tắt AI

IBM giới thiệu BenchDrift, khung đánh giá cho thấy việc thay đổi cách đặt câu hỏi có thể làm điểm số LLM chênh lệch tới 74,7%. Ngay cả với các mô hình mạnh, 18,5% câu trả lời đúng vẫn bị mất đi khi diễn đạt lại dù ý nghĩa không đổi.

Bài viết được AI dịch và tổng hợp tự động từ X: Rohan Paul (@rohanpaul_ai). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Khung BenchDrift của IBM: Cách diễn đạt khiến điểm số LLM biến động tới 74,7% | AIHOT.vn