DAIR.AI@dair_aiNghiên cứuĐiểm AI 43/100
Nghiên cứu mới: LLM làm 'giám khảo' không còn đáng tin cậy trong các cuộc hội thoại thực tế
// Your LLM judge disagrees with the experts // LLM Judges can be tricky to build. Here is an inte…
DịchNghiên cứu chỉ ra rằng các chỉ số tự động và phương pháp 'LLM-as-a-judge' truyền thống không khớp với đánh giá của chuyên gia. Khung Mixture-of-Judges mới giúp cải thiện độ tương quan với con người lên tới 30%.
