Nghiên cứu
LongWoF-Bench: Đánh giá tác vụ dài hạn thông qua tiến hóa gen EvoMap
(giờ Việt Nam)
Tóm tắt AI
LongWoF-Bench cung cấp 778 tác vụ kiểm chứng tự động cho LLM. Phương pháp EvoMap giúp cải thiện hiệu suất trung bình từ 8.7-15.5% trên nhiều mô hình, đồng thời tối ưu hóa đáng kể chi phí token.
Chính văn · Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Junjie Wang [xem email] [v1] Thứ Hai, 24 tháng 8 năm 2026 12:50:16 UTC (1.281 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.