Nghiên cứuĐiểm AI 85/100
Độ chính xác và sự nhạy cảm với thứ tự đáp án trong các mô hình ngôn ngữ lớn
Nghiên cứu chỉ ra rằng các bài kiểm tra trắc nghiệm thường bị nhiễu do thứ tự đáp án, và việc loại bỏ nhãn lựa chọn không giúp cải thiện độ chính xác thực tế của mô hình.