Ma Dongxi NLP@dongxi_nlpNgànhĐiểm AI 24/100
DeepSeek ra mắt CED: Tối ưu hóa KV Caching, tăng tốc độ xử lý mô hình
DeepSeek giới thiệu kỹ thuật CED giúp chia sẻ KV cache giữa các lớp, từ đó giảm thiểu lưu trữ dư thừa và tăng tốc độ tính toán prefill, giúp mô hình vận hành nhanh và mạnh mẽ hơn.