Apple giới thiệu phương pháp chưng cất mới giúp nén bộ mã hóa âm thanh cho tính năng đọc chính tả toàn hệ thống, đạt hiệu suất vượt trội với tỷ lệ nén 2.8x mà vẫn giữ nguyên độ chính xác.
GeoPair là khung làm việc mới giúp nén mô hình Transformer hiệu quả bằng cách tối ưu hóa các cặp trọng số liên lớp và phân rã từ điển chia sẻ, giúp duy trì độ chính xác mà không cần huấn luyện lại.
DịchĐội ngũ Tencent Hunyuan đã nén mô hình Hy4 preview từ 1,5TB xuống còn 214 GiB mà vẫn giữ nguyên 770 tỷ tham số nhờ thuật toán Sherry và định dạng STQ1_0, đạt mức trung bình 2,38 bit mỗi trọng số.
Multiverse giới thiệu phương pháp cắt tỉa khối LLM bằng cách chuyển đổi thành bài toán tối ưu hóa Ising, giúp chọn cấu hình nén tối ưu mà không cần chạy benchmark. Kết quả trên Llama-3.3-70B cho thấy hiệu suất vượt trội, tăng 23% điểm MMLU so với các phương pháp truyền thống.
Nghiên cứu giới thiệu phương pháp nén mô hình Cellpose-SAM giúp giảm dung lượng lưu trữ tới 6,76 lần mà vẫn duy trì độ chính xác cao khi phân tích hình ảnh tế bào gốc trên các thiết bị phần cứng hạn chế.
PrismML vừa phát hành Ternary Bonsai 2 27B, mô hình nén 3-giá trị chỉ nặng 5,93 GB nhưng vẫn duy trì 98,2% hiệu năng của bản gốc Qwen 27B, hỗ trợ đa phương thức và cửa sổ ngữ cảnh lên tới 262K token.
Dựa trên Qwen 27B, Ternary Bonsai 2 sử dụng kỹ thuật trọng số tam phân để giảm dung lượng xuống chỉ còn 5,9GB, giúp tối ưu hóa đáng kể khả năng chạy mô hình lớn trên phần cứng hạn chế.
Intel đề xuất BITCOS, phương pháp lưu trữ trọng số tam phân giúp giảm dung lượng xuống dưới 1.58 bit/trọng số, tối ưu hóa hiệu suất cho các mô hình AI hiện đại.
Nhóm nghiên cứu đạt giải nhất hạng mục dưới 2B tham số tại ECCV 2026 bằng cách chưng cất mô hình lớn thành mô hình 2B nhỏ gọn, đạt 89% hiệu suất của bản gốc với chỉ 1,1% tài nguyên.
X-AuT sử dụng kỹ thuật cắt tỉa dần dần và chưng cất đa quy mô để nén bộ mã hóa âm thanh của LLM, giúp giảm số lớp Transformer mà vẫn cải thiện độ chính xác trên các bài kiểm tra tiếng Anh và tiếng Trung.
SQS là khung làm việc thống nhất kết hợp cắt tỉa và lượng tử hóa bit thấp thông qua học biến phân Bayes, giúp nén mô hình hiệu quả hơn mà vẫn duy trì độ chính xác cao.
Nghiên cứu Minima chứng minh khả năng duy trì hiệu suất vượt trội của kiến trúc Gated DeltaNet khi áp dụng định dạng lượng tử hóa NVFP4 W4A4 trên toàn bộ các lớp tuyến tính của mô hình Qwen3.8-27B.
Debias-SparseGPT là kỹ thuật cắt tỉa hậu huấn luyện giúp giảm định kiến xã hội trong các mô hình ngôn ngữ lớn mà vẫn duy trì độ chính xác và hiệu suất, ngay cả ở cấu trúc nén 2:4 khắt khe.
Bài viết giải quyết bài toán nan giải khi chạy các mô hình 70B tham số trên phần cứng tiêu dùng, hướng dẫn kỹ thuật tối ưu hóa dung lượng mà vẫn giữ vững hiệu năng xử lý.
Tencent giới thiệu bản preview Hunyuan Hy4 sử dụng thuật toán nén Sherry và chiến lược MIX-STQ1_0, giúp giảm dung lượng mô hình từ 1.5TB xuống còn 214GB mà vẫn duy trì hiệu suất.
Hy4 preview is now available on WorkBuddy, where users can switch between Work and Coding tasks. Th…
DịchTencent Hy4 Preview đã có mặt trên WorkBuddy, cho phép xử lý đa nhiệm từ viết code đến làm việc. Nhờ công nghệ nén MIX-STQ1_0, mô hình chỉ còn 200GiB GGUF, giúp chạy cục bộ mà vẫn giữ được độ chính xác gần như tương đương bản gốc BF16.
We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well! Meet MIX-STQ1_0.The…
DịchTencent đã tối ưu hóa mô hình Hunyuan Hy4-preview từ 1.5TB xuống còn 200GB định dạng GGUF bằng kỹ thuật lượng tử hóa hỗn hợp MIX-STQ1_0, giúp mô hình khổng lồ chạy mượt mà hơn trên phần cứng hạn chế.
Phương pháp QAH giúp phục hồi khả năng suy luận và lập trình cho các mô hình LLM sau khi nén và lượng tử hóa 4-bit bằng cách chưng cất trực tiếp từ mô hình gốc, thay thế hiệu quả cho kỹ thuật QAT truyền thống.
Phương pháp mới giúp tối ưu hóa mô hình AI bằng cách nén xuống 4-bit mà vẫn giữ nguyên hoặc cải thiện hiệu suất so với mô hình gốc, giải quyết bài toán đánh đổi giữa tốc độ và độ chính xác.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong tối ưu hóa mô hình, giúp giảm tài nguyên tính toán đáng kể mà không làm mất đi chất lượng, rất hữu ích cho cộng đồng phát triển AI.
Llama-Mobile giới thiệu phương pháp nén mô hình VLMs xuống định dạng 2.7-bit, cho phép chạy mượt mà trên chip Arm mà vẫn giữ vững hiệu suất, giúp đưa các mô hình lớn như Llama 3.2 11B lên smartphone.
Vì sao đáng đọc: Đây là bước tiến quan trọng cho ứng dụng AI trên thiết bị (on-device AI), giải quyết bài toán tài nguyên phần cứng vốn là rào cản lớn nhất hiện nay.
Atomic has released Dynamic Quants for Qwen3.8-27B-GGUF, a quantized version of Qwen3.8 27B, compres…
DịchAtomic vừa phát hành phiên bản Qwen3.8-27B với công nghệ nén GGUF động, giảm dung lượng từ 28.9GB xuống chỉ còn 8.5GB. Đáng chú ý, phiên bản AD-IQ3_S có thể chạy mượt trên MacBook Air 16GB mà vẫn giữ được 92.4% độ chính xác so với bản gốc BF16.
UniMoMo là khung nén mô hình sau huấn luyện giúp giảm quy mô các lớp MoE trong hệ thống gợi ý bằng cách hợp nhất các chuyên gia có chức năng tương đồng, giúp tối ưu hóa hiệu năng mà không cần thêm module phụ.