HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 45/100

Nghiên cứu

LongWoF-Bench: Đánh giá tác vụ dài hạn thông qua tiến hóa gen EvoMap

(giờ Việt Nam)

Tóm tắt AI

LongWoF-Bench cung cấp 778 tác vụ kiểm chứng tự động cho LLM. Phương pháp EvoMap giúp cải thiện hiệu suất trung bình từ 8.7-15.5% trên nhiều mô hình, đồng thời tối ưu hóa đáng kể chi phí token.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Junjie Wang [xem email] [v1] Thứ Hai, 24 tháng 8 năm 2026 12:50:16 UTC (1.281 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

LongWoF-Bench: Đánh giá tác vụ dài hạn thông qua tiến hóa gen EvoMap | AIHOT.vn