DAIR.AI@dair_ai
Điểm AI 43/100

Nghiên cứu

Nghiên cứu mới: LLM làm 'giám khảo' không còn đáng tin cậy trong các cuộc hội thoại thực tế

(giờ Việt Nam)

Nguyên văn trên X

// Your LLM judge disagrees with the experts // LLM Judges can be tricky to build. Here is an inte…

Dịch · tóm tắt AI

Nghiên cứu chỉ ra rằng các chỉ số tự động và phương pháp 'LLM-as-a-judge' truyền thống không khớp với đánh giá của chuyên gia. Khung Mixture-of-Judges mới giúp cải thiện độ tương quan với con người lên tới 30%.

Bài viết được AI dịch và tổng hợp tự động từ X: DAIR.AI (@dair_ai). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Nghiên cứu mới: LLM làm 'giám khảo' không còn đáng tin cậy trong các cuộc hội thoại thực tế | AIHOT.vn