Ngành
ImpossibleRubrics: Thử thách khả năng đánh giá của AI bằng 169 nhiệm vụ bất khả thi
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu bộ tiêu chuẩn ImpossibleRubrics với 169 nhiệm vụ phi logic nhằm kiểm tra xem các mô hình chấm điểm AI có bị đánh lừa bởi những câu trả lời sai lệch hay không.
Chính văn · Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Bowen Qin [xem email] [v1] Thứ Ba, 15 tháng 9, 2026 08:21:40 UTC (299 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.