Đội ngũ MiMo của Xiaomi phát triển kiến trúc HySparse2 cho mô hình MiMo-V3, giúp giảm đáng kể chi phí tính toán prefill và bộ nhớ KV cache so với các thế hệ tiền nhiệm trên cấu trúc 80B-A3B MoE.
Xiaomi giới thiệu kiến trúc HySparse2 trên nền tảng MiMo-V3, sử dụng cơ chế chia sẻ KV hai cấp và chọn lọc token thưa để tăng tốc độ xử lý cho các tác vụ Agent đòi hỏi ngữ cảnh dài.
Xiaomi giới thiệu kiến trúc HySparse2 cho mô hình MiMo-V3, sử dụng cơ chế chia sẻ KV hai cấp và chọn lọc token thưa để giảm thiểu chi phí tính toán Prefill và bộ nhớ KV Cache cho các tác vụ Agent phức tạp.
Xiaomi xác nhận MiMo-V3 sẽ sử dụng kiến trúc HySparse2, giúp giảm đáng kể chi phí suy luận và bộ nhớ KV cache khi xử lý ngữ cảnh lên tới 1 triệu token, tối ưu hóa hiệu suất cho các tác vụ AI agent.
Đội ngũ LLM-Core của Xiaomi công bố HySparse2, kiến trúc chú ý thưa (sparse-attention) với cơ chế chia sẻ KV hai cấp, giúp tối ưu hóa hiệu suất cho các mô hình tác nhân MiMo-V3 bằng cách giảm đáng kể khối lượng tính toán khi xử lý ngữ cảnh dài.
MiMo-V3 is getting a new architecture. The core of it, HySparse2, is out today. Less prefill, a sma…
DịchKiến trúc HySparse2 mới của MiMo-V3 giúp giảm 5,02 lần FLOPs prefill và thu nhỏ 4,5 lần KV cache so với bản tiền nhiệm, đồng thời cải thiện đáng kể hiệu suất trên các bài kiểm tra độ dài ngữ cảnh lớn.