Google DeepMind giới thiệu DiffusionGemma, mô hình khuếch tán văn bản mã nguồn mở dựa trên kiến trúc Gemma 2 26B MoE, mang lại hiệu suất tạo văn bản vượt trội với tốc độ ấn tượng trên một GPU H100 duy nhất.
5× context compression did surprisingly little to GPT-5.5's final task result. The compressed agent…
DịchNghiên cứu cho thấy việc nén ngữ cảnh 5 lần không làm giảm đáng kể kết quả tác vụ của GPT-5.5. Thay vì mất đi khả năng xử lý, mô hình chuyển sang dựa vào cơ chế truy xuất dữ liệu để bù đắp thông tin bị lược bỏ.
Hugging Face giới thiệu các mô hình dự đoán DSpark cho dòng LFM2.5, giúp tăng tốc độ xử lý trên GPU lên 3,18 lần và thiết bị đầu cuối lên 2,87 lần mà không làm giảm chất lượng đầu ra. Công nghệ này đã hỗ trợ mã nguồn mở cho llama.cpp và SGLang.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giúp tối ưu hóa hiệu suất mô hình nhỏ, có tính ứng dụng cao cho cộng đồng phát triển AI và triển khai thực tế.
Dòng mô hình Ornith-1.5 mã nguồn mở vừa ra mắt với khả năng tự cải tiến, cùng các kỹ thuật nén dữ liệu mới giúp tăng độ chính xác và giảm chi phí vận hành đáng kể cho các tác nhân AI.
Liquid AI giới thiệu các checkpoint Q4_0 cho dòng mô hình LFM 2.5, sử dụng kỹ thuật chưng cất nhận thức lượng tử (QAD) để duy trì tốc độ cao trong khi khôi phục tới 97% độ chính xác so với chuẩn BF16.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giúp tối ưu hóa mô hình nhỏ (SLM) cho thiết bị biên, rất hữu ích cho cộng đồng phát triển AI tại Việt Nam.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
MoE-ViE tối ưu hóa khả năng hiểu hình ảnh và video bằng kiến trúc chuyên gia hỗn hợp (MoE), đạt hiệu suất vượt trội với độ trễ thấp hơn 24% so với các mô hình cùng kích thước, thiết lập chuẩn mực mới cho các mô hình đa phương thức.
ANOLISA (Alibaba Cloud Linux 4 Agentic Edition) is an agent-first operating system designed for AI A…
DịchAlibaba Cloud giới thiệu ANOLISA, hệ điều hành ưu tiên AI Agent với lớp hiệu suất Tokenless giúp giảm thiểu tiêu thụ token mà không làm thay đổi quy trình làm việc. Hệ thống hiện đã mã nguồn mở và hỗ trợ triển khai trực tiếp trên ECS.
Các nhà nghiên cứu từ Đại học Phúc Đán và Yinwang giới thiệu WAM-Diff2, khung mô hình VLA giúp chuyển đổi từ kiến trúc tự hồi quy sang khuếch tán, tăng tốc độ giải mã lên 15,1 lần mà vẫn giữ nguyên hiệu suất đa nhiệm.
Vì sao đáng đọc: Nghiên cứu giải quyết trực tiếp bài toán độ trễ trong xe tự lái bằng cách kết hợp ưu điểm của mô hình khuếch tán và tự hồi quy, có tính ứng dụng thực tiễn cao.
Nghiên cứu giới thiệu phương pháp dự đoán đa byte (MBP) giúp tăng tốc độ suy luận cho các mô hình ngôn ngữ cấp byte mà không làm giảm hiệu suất hay tăng số lượng tham số.
Incredible stuff. Now I need a Navi fairy companion version.
DịchChuyên gia fofr đánh giá cao TypeGPU khi chạy mô hình độ sâu 448x448 trên chip M4 Pro chỉ trong 8ms. Giải pháp này tối ưu hóa hiệu suất bằng cách hợp nhất quy trình suy luận, chiếu sáng và kết xuất vào cùng một bộ mã hóa lệnh mà không cần đồng bộ GPU.
TensorCast là lớp quản lý tensor lập trình được giúp tối ưu hóa hạ tầng mô hình lớn, giảm đáng kể thời gian phản hồi token đầu tiên và tăng tốc khởi tạo mô hình trong các tác vụ AI đa nhiệm.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong tối ưu hóa hạ tầng LLM, có tính ứng dụng cao cho các hệ thống AI quy mô lớn và độ trễ thấp.
Số mới nhất của Hongming Weekly đi sâu vào thực tiễn kỹ thuật AI Agent, tập trung vào 6 khía cạnh then chốt từ mô hình thực thi, kiểm thử chất lượng, đa tác nhân cho đến tối ưu hóa bộ nhớ đệm.
🚀Qwen3.8-27B flies on a laptop, becoming part of our work and daily lives. Thanks for the shoutout! …
DịchMô hình Qwen3.8-27B hiện đã được tối ưu để vận hành trơn tru trên máy tính xách tay thông qua nền tảng Atomic Chat, giúp đưa sức mạnh AI vào công việc và đời sống hàng ngày.
What if you could pay the reasoning cost once, then reuse what the model learned across future tasks…
DịchMicrosoft đề xuất phương pháp chuyển đổi các mô hình suy luận đắt đỏ thành bộ quy tắc nhỏ gọn. Bằng cách trích xuất kinh nghiệm từ các lần chạy trước, phương pháp này giúp giảm tới 4,5 lần lượng token đầu ra mà vẫn duy trì hiệu suất vượt trội trên các tác vụ thông minh.
Excited to see Qwen3.8 running at scale with TokenSpeed! 🚀 Light on latency, big on speed. Kudos to…
DịchMô hình Qwen3.8 với 2.4 nghìn tỷ tham số đã được tối ưu hóa thông qua công cụ TokenSpeed, giúp tăng tốc độ xử lý hơn 30% so với phương pháp TP16 truyền thống nhờ kỹ thuật giải mã suy đoán DSpark và tối ưu hóa CUDA graph.
2 things are happening at once: - AI coding models are converging. For 95% of tasks, most people ca…
DịchSự khác biệt giữa các mô hình AI hàng đầu đang dần thu hẹp, trong khi các mô hình nhỏ gọn và mã nguồn mở như GLM-5.3 đang trở nên hiệu quả và phổ biến hơn, báo hiệu một bước ngoặt lớn trong ngành.
Startup Pháp Kog phát triển giải pháp phần mềm giúp khai thác tối đa hiệu năng GPU trung tâm dữ liệu, đạt tốc độ 3.000 token/giây và hứa hẹn tăng tốc suy luận LLM gấp 30 lần.
SKILLER giải quyết thách thức trong việc tự động tạo các kỹ năng hiệu quả cho mô hình ngôn ngữ nhỏ, giúp giảm chi phí vận hành tác vụ mà vẫn đảm bảo hiệu suất cao trên phần cứng phổ thông.
Cactus Compute ra mắt Needle 2, mô hình AI chuyên về gọi công cụ với dung lượng chỉ 14MB, cho phép chạy mượt mà trên các thiết bị hạn chế tài nguyên với mức tiêu thụ RAM cực thấp.
HeyGen đã chuyển đổi mô hình tạo video Avatar IV với hơn 18 tỷ tham số sang nền tảng Google Cloud Trillium TPU, sử dụng kỹ thuật song song hóa tiên tiến để tăng tốc hiệu suất.
Very interesting new paper from Microsoft and colleagues. (bookmark it) Skill libraries are used i…
DịchNghiên cứu của Microsoft chỉ ra rằng các kỹ năng không cần thiết trong thư viện khiến AI Agent dễ mắc lỗi hoặc giảm hiệu suất do quá trình xác thực dư thừa và quy trình thực thi phức tạp.
Nghiên cứu mới giới thiệu phương pháp dùng mô hình mạnh để tạo 'harness' hỗ trợ mô hình yếu giải quyết vấn đề phức tạp. Kết quả cho thấy hiệu suất tăng vọt từ 0.49 lên 0.91 nhờ tối ưu hóa quy trình suy luận và định dạng đầu ra.
Hướng dẫn chi tiết cách tối ưu hóa quy trình hậu huấn luyện Tulu 3 trên phần cứng hạn chế (16GB VRAM), thay thế các thành phần phân tán phức tạp bằng công cụ nhẹ để thực hiện SFT, DPO và học tăng cường dựa trên xác thực (GRPO).
Chỉ sau một tuần mở mã nguồn, MiniMax H3 đã tạo cơn sốt với gần 300 biến thể trên Hugging Face. Cộng đồng đã tối ưu hóa trọng số xuống còn 42.5GB để chạy trên GPU phổ thông, đồng thời phát triển engine suy luận riêng cho Mac.
Expedia recently moved its ranking models to a state-of-the-art Keras 3 setup. Results: 30% faster t…
DịchExpedia đã chuyển đổi mô hình xếp hạng lưu trú sang kiến trúc Keras 3, giúp tối ưu hóa hiệu suất vượt trội với tốc độ huấn luyện nhanh hơn 30% và giảm đáng kể độ trễ suy luận.
UniMoMo là khung nén mô hình sau huấn luyện giúp giảm quy mô các lớp MoE trong hệ thống gợi ý bằng cách hợp nhất các chuyên gia có chức năng tương đồng, giúp tối ưu hóa hiệu năng mà không cần thêm module phụ.
Nvidia vừa giới thiệu hệ thống Nemotron 3.5 Lightning cùng công cụ NeMo Switchyard, giúp tối ưu hóa hiệu suất suy luận và tăng tính linh hoạt khi triển khai các mô hình ngôn ngữ lớn (LLM).