19/09

Thứ Bảy · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnKV Cache không cần 'chọn lọc kỹ'? Phương pháp xóa ngẫu nhiên đạt hiệu suất tương đương, tăng tốc độ suy luận tới 43%

Nghiên cứu mới từ Salesforce và UIUC cho thấy việc xóa ngẫu nhiên các token trong KV Cache mang lại hiệu quả tương đương các thuật toán phức tạp, đồng thời giúp tăng đáng kể tốc độ suy luận nhờ giảm tải tính toán.


Vì sao đáng đọc: Đây là một phát hiện mang tính 'phản trực giác' nhưng có tác động lớn đến tối ưu hóa hạ tầng AI, giúp giảm chi phí vận hành mô hình ngôn ngữ lớn một cách thực tế.

18/09

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Mô hìnhĐiểm AI 85/100

Tinh chọnDeepSeek-V4.1-Flash ra mắt: Mô hình MoE 552B đa phương thức với công nghệ nén KV cache đột phá

DeepSeek vừa trình làng DeepSeek-V4.1-Flash, mô hình MoE đa phương thức 552 tỷ tham số hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token, hiện đã có sẵn trên Hugging Face.

Diễn biến sự kiện · 5 bài →Thêm 1 nguồn khác đưa tinHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

Vì sao đáng đọc: Đây là bước tiến lớn về hiệu năng của DeepSeek với khả năng xử lý ngữ cảnh cực dài và tối ưu hóa bộ nhớ, thu hút sự quan tâm lớn từ cộng đồng AI.

17/09

Thứ Năm · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Fathom: Tối ưu hóa tốc độ giải mã cho KV Cache dung lượng lớn thông qua kỹ thuật đọc chọn lọc

Fathom giới thiệu phương pháp đọc KV cache linh hoạt dựa trên ngân sách bit cho từng truy vấn, giúp tăng tốc độ giải mã lên 1,67 lần ở quy mô 1 triệu token mà vẫn duy trì độ chính xác cao hơn so với các kỹ thuật hiện có.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 74/100

Giải mã DeepSeek-V4.1-Flash: Công nghệ nén KV Cache đột phá chỉ với 890 byte mỗi token

Bài viết phân tích kỹ thuật chuyên sâu về DeepSeek-V4.1-Flash, làm rõ cách thức CED và CSA2 tối ưu hóa bộ nhớ KV Cache, đồng thời đánh giá đây là bước nhảy vọt về kiến trúc tương đương thế hệ V5.

karminski@karminski3
Quan điểmĐiểm AI 36/100

KV Cache phân tầng: Cuộc đối đầu giữa PMem và hạ tầng RDMA 400Gb

Thử nghiệm thực tế cho thấy Intel Optane PMem không hiệu quả cho KV Cache do tốc độ ghi chậm và giới hạn NUMA. Chuyên gia đề xuất sử dụng hạ tầng RDMA 400Gb để đạt băng thông 40GB/s, đảm bảo hiệu suất tối ưu cho các hệ thống suy luận AI tách biệt tài nguyên tính toán và lưu trữ.

16/09

Thứ Tư · 1 tin

15/09

Thứ Ba · 1 tin

13/09

Chủ Nhật · 3 tin
Ma Dongxi NLP@dongxi_nlp
NgànhĐiểm AI 44/100

Cùng sự kiệnTại sao KV Cache trong LLM lại lưu trữ K và V mà bỏ qua Q?

Bài viết giải thích cơ chế KV Cache trong suy luận LLM: K và V của các token trước được lưu lại để tái sử dụng, trong khi Q chỉ dùng cho vị trí hiện tại nên không cần lưu trữ.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»

11/09

Thứ Sáu · 2 tin

10/09

Thứ Năm · 1 tin
Ma Dongxi NLP@dongxi_nlp
NgànhĐiểm AI 36/100

Cùng sự kiệnDeepSeek-V4.1-Flash: Đột phá tối ưu hóa nén KV Cache

DeepSeek-V4.1-Flash giới thiệu kiến trúc Causal Encoder-Decoder mới, cho phép tạo KV Cache toàn cục trực tiếp từ đầu ra của encoder. Cải tiến này giúp lược bỏ việc xử lý prompt qua toàn bộ các lớp decoder, từ đó tối ưu hóa đáng kể tốc độ tiền xử lý (prefill) cho mô hình.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»

09/09

Thứ Tư · 2 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 47/100

KVMem: Giải pháp ảo hóa không gian làm việc cho AI Agent với dung lượng triệu token

Nice paper to improve inference efficiency. It's been a while we haven't seen good work on efficien…

DịchKVMem tối ưu hóa bộ nhớ cho AI Agent bằng cách phân trang và lưu trữ trạng thái KV trên GPU, RAM và NVMe. Hệ thống sử dụng cơ chế chỉ mục chú ý để truy xuất thông tin lịch sử liên quan, giúp xử lý ngữ cảnh siêu dài một cách hiệu quả.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnBeaconKV: Tối ưu bộ nhớ KV Cache cho mô hình suy luận lớn thông qua truy vấn Beacon

BeaconKV giải quyết nút thắt bộ nhớ khi suy luận dài bằng cách xác định các 'Thought Revisiting Tokens' quan trọng, giúp nén KV cache hiệu quả mà không làm giảm khả năng truy xuất ngữ cảnh xa.


Vì sao đáng đọc: Giải pháp kỹ thuật thực tế, giải quyết vấn đề cấp bách về bộ nhớ GPU cho các mô hình suy luận dài (LRMs), có tính ứng dụng cao trong triển khai thực tế.

04/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

Random Attention: Tối ưu hóa KV Cache bằng cơ chế loại bỏ ngẫu nhiên giúp tăng tốc suy luận LLM

Salesforce giới thiệu Random Attention, phương pháp thay thế việc đánh giá token bằng cách loại bỏ ngẫu nhiên trong KV cache. Kỹ thuật này giúp tăng 32-43% lưu lượng xử lý trên vLLM mà vẫn duy trì độ chính xác tương đương các phương pháp tiên tiến nhất.

31/08

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 45/100

Nghiên cứu từ Amazon: Tối ưu hóa KV Cache giúp mô hình AI không bị 'mất trí nhớ' khi xử lý văn bản dài

New Amazon paper shows KV-cache policy is not just an inference optimization; but it can change the …

DịchNghiên cứu mới của Amazon chỉ ra rằng việc đồng bộ hóa chiến lược KV Cache trong quá trình tinh chỉnh (fine-tuning) giúp mô hình tránh lỗi mất ngữ cảnh khi xử lý văn bản dài, thay vì chỉ tập trung vào tối ưu suy luận như trước đây.

13/08

Thứ Năm · 1 tin
Tổng 19 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (36 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “KV Cache” | AIHOT.vn