# Prefix Sliding: Phương pháp đột phá giúp tối ưu bộ nhớ và tăng tốc suy luận cho LLM

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-08-26 07:00 (giờ Việt Nam)
- Điểm AI: 52/100
- Link AIHOT.vn: https://aihot.vn/items/8203d883302aa2bf
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtblkn7e11d1roamia6i2vj2
- Link gốc: https://arxiv.org/abs/2608.26070

## Tóm tắt AI

Prefix Sliding giúp giảm bộ nhớ suy luận xuống mức hằng số bằng cách loại bỏ các token trung gian không cần thiết, giúp tăng tốc độ xử lý gấp 3 lần mà không cần huấn luyện lại.

## Thân bài

Tác giả: Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John Yang, Dapeng Jiang, Mika Senghaas, Fares Obeid, Johannes Hagemann, Sami Jaghouar, Ludwig Schmidt, Percy Liang, Jason Wei, Andrew Y. Ng, Luke Zettlemoyer, Yejin Choi, Mike Lewis

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Niklas Muennighoff [xem email] [v1] Thứ Tư, 26 tháng 8 năm 2026 17:37:15 UTC (1.666 KB)
