# Random Attention: Tối ưu hóa KV Cache bằng cơ chế loại bỏ ngẫu nhiên giúp tăng tốc suy luận LLM

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-03 07:00 (giờ Việt Nam)
- Điểm AI: 52/100
- Link AIHOT.vn: https://aihot.vn/items/e447b2d0c4e6ed57
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtmeb7fn00xbrotx0so0znla
- Link gốc: https://arxiv.org/abs/2609.03430

## Tóm tắt AI

Salesforce giới thiệu Random Attention, phương pháp thay thế việc đánh giá token bằng cách loại bỏ ngẫu nhiên trong KV cache. Kỹ thuật này giúp tăng 32-43% lưu lượng xử lý trên vLLM mà vẫn duy trì độ chính xác tương đương các phương pháp tiên tiến nhất.

## Thân bài

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Heng Wang [xem email] [v1] Thứ Năm, ngày 3 tháng 9 năm 2026 06:38:38 UTC (102 KB)
