# LongWoF-Bench: Đánh giá tác vụ dài hạn thông qua tiến hóa gen EvoMap

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-08-24 07:00 (giờ Việt Nam)
- Điểm AI: 45/100
- Link AIHOT.vn: https://aihot.vn/items/786671f66930be5b
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmt8mdxkv3ftrro73mgavt0qw
- Link gốc: https://arxiv.org/abs/2608.23200

## Tóm tắt AI

LongWoF-Bench cung cấp 778 tác vụ kiểm chứng tự động cho LLM. Phương pháp EvoMap giúp cải thiện hiệu suất trung bình từ 8.7-15.5% trên nhiều mô hình, đồng thời tối ưu hóa đáng kể chi phí token.

## Thân bài

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Junjie Wang [xem email] [v1] Thứ Hai, 24 tháng 8 năm 2026 12:50:16 UTC (1.281 KB)
