21/08

Thứ Sáu · 4 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 79/100

Google DeepMind ra mắt DiffusionGemma: Mô hình khuếch tán rời rạc với tốc độ 1500 token/giây trên H100

Google DeepMind giới thiệu DiffusionGemma, mô hình khuếch tán văn bản mã nguồn mở dựa trên kiến trúc Gemma 2 26B MoE, mang lại hiệu suất tạo văn bản vượt trội với tốc độ ấn tượng trên một GPU H100 duy nhất.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 32/100

Nén ngữ cảnh gấp 5 lần trên GPT-5.5: Hiệu quả không đổi nhưng cách thức thay đổi

5× context compression did surprisingly little to GPT-5.5's final task result. The compressed agent…

DịchNghiên cứu cho thấy việc nén ngữ cảnh 5 lần không làm giảm đáng kể kết quả tác vụ của GPT-5.5. Thay vì mất đi khả năng xử lý, mô hình chuyển sang dựa vào cơ chế truy xuất dữ liệu để bù đắp thông tin bị lược bỏ.

Hugging Face: Blog
Mô hìnhĐiểm AI 61/100

Tinh chọnHugging Face ra mắt dòng mô hình DSpark: Tăng tốc suy luận lên đến 3,18 lần

Hugging Face giới thiệu các mô hình dự đoán DSpark cho dòng LFM2.5, giúp tăng tốc độ xử lý trên GPU lên 3,18 lần và thiết bị đầu cuối lên 2,87 lần mà không làm giảm chất lượng đầu ra. Công nghệ này đã hỗ trợ mã nguồn mở cho llama.cpp và SGLang.

Thêm 1 nguồn khác đưa tinMarkTechPost

Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giúp tối ưu hóa hiệu suất mô hình nhỏ, có tính ứng dụng cao cho cộng đồng phát triển AI và triển khai thực tế.

20/08

Thứ Năm · 1 tin

19/08

Thứ Tư · 5 tin
Hugging Face: Blog
Mô hìnhĐiểm AI 64/100

Tinh chọnLiquid AI ra mắt dòng LFM 2.5 với kỹ thuật QAD: Khôi phục 97% độ chính xác sau khi lượng tử hóa

Liquid AI giới thiệu các checkpoint Q4_0 cho dòng mô hình LFM 2.5, sử dụng kỹ thuật chưng cất nhận thức lượng tử (QAD) để duy trì tốc độ cao trong khi khôi phục tới 97% độ chính xác so với chuẩn BF16.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giúp tối ưu hóa mô hình nhỏ (SLM) cho thiết bị biên, rất hữu ích cho cộng đồng phát triển AI tại Việt Nam.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

MoE-ViE: Bước tiến mới cho bộ mã hóa thị giác hiệu suất cao

MoE-ViE tối ưu hóa khả năng hiểu hình ảnh và video bằng kiến trúc chuyên gia hỗn hợp (MoE), đạt hiệu suất vượt trội với độ trễ thấp hơn 24% so với các mô hình cùng kích thước, thiết lập chuẩn mực mới cho các mô hình đa phương thức.

Alibaba Cloud@alibaba_cloud
Sản phẩmĐiểm AI 63/100

Alibaba Cloud ra mắt ANOLISA: Hệ điều hành tối ưu cho AI Agent

ANOLISA (Alibaba Cloud Linux 4 Agentic Edition) is an agent-first operating system designed for AI A…

DịchAlibaba Cloud giới thiệu ANOLISA, hệ điều hành ưu tiên AI Agent với lớp hiệu suất Tokenless giúp giảm thiểu tiêu thụ token mà không làm thay đổi quy trình làm việc. Hệ thống hiện đã mã nguồn mở và hỗ trợ triển khai trực tiếp trên ECS.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnWAM-Diff2: Đột phá tốc độ giải mã gấp 15 lần cho mô hình VLA trong xe tự lái

Các nhà nghiên cứu từ Đại học Phúc Đán và Yinwang giới thiệu WAM-Diff2, khung mô hình VLA giúp chuyển đổi từ kiến trúc tự hồi quy sang khuếch tán, tăng tốc độ giải mã lên 15,1 lần mà vẫn giữ nguyên hiệu suất đa nhiệm.


Vì sao đáng đọc: Nghiên cứu giải quyết trực tiếp bài toán độ trễ trong xe tự lái bằng cách kết hợp ưu điểm của mô hình khuếch tán và tự hồi quy, có tính ứng dụng thực tiễn cao.

18/08

Thứ Ba · 1 tin
fofr@fofrAI
Hướng dẫnĐiểm AI 28/100

TypeGPU gây ấn tượng với khả năng suy luận mô hình độ sâu đơn mắt thời gian thực

Incredible stuff. Now I need a Navi fairy companion version.

DịchChuyên gia fofr đánh giá cao TypeGPU khi chạy mô hình độ sâu 448x448 trên chip M4 Pro chỉ trong 8ms. Giải pháp này tối ưu hóa hiệu suất bằng cách hợp nhất quy trình suy luận, chiếu sáng và kết xuất vào cùng một bộ mã hóa lệnh mà không cần đồng bộ GPU.

17/08

Thứ Hai · 1 tin
Pandaily
Nghiên cứuĐiểm AI 88/100

Tinh chọnĐại học Bắc Kinh và StepFun ra mắt TensorCast: Giải pháp tăng tốc phản hồi LLM lên tới 93,2%

TensorCast là lớp quản lý tensor lập trình được giúp tối ưu hóa hạ tầng mô hình lớn, giảm đáng kể thời gian phản hồi token đầu tiên và tăng tốc khởi tạo mô hình trong các tác vụ AI đa nhiệm.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong tối ưu hóa hạ tầng LLM, có tính ứng dụng cao cho các hệ thống AI quy mô lớn và độ trễ thấp.

16/08

Chủ Nhật · 2 tin
Qwen@Alibaba_Qwen
Hướng dẫnĐiểm AI 33/100

Mô hình Qwen3.8-27B đã có thể chạy mượt mà trên laptop nhờ Atomic Chat

🚀Qwen3.8-27B flies on a laptop, becoming part of our work and daily lives. Thanks for the shoutout! …

DịchMô hình Qwen3.8-27B hiện đã được tối ưu để vận hành trơn tru trên máy tính xách tay thông qua nền tảng Atomic Chat, giúp đưa sức mạnh AI vào công việc và đời sống hàng ngày.

Thêm 1 nguồn khác đưa tinTomer Tunguz Blog (phân tích VC)

15/08

Thứ Bảy · 3 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Microsoft: Thay thế suy luận tốn kém bằng 'kỹ năng chưng cất' để tối ưu chi phí

What if you could pay the reasoning cost once, then reuse what the model learned across future tasks…

DịchMicrosoft đề xuất phương pháp chuyển đổi các mô hình suy luận đắt đỏ thành bộ quy tắc nhỏ gọn. Bằng cách trích xuất kinh nghiệm từ các lần chạy trước, phương pháp này giúp giảm tới 4,5 lần lượng token đầu ra mà vẫn duy trì hiệu suất vượt trội trên các tác vụ thông minh.

Qwen@Alibaba_Qwen
Sản phẩmĐiểm AI 31/100

Qwen3.8 đạt bước tiến lớn trong triển khai quy mô nhờ TokenSpeed

Excited to see Qwen3.8 running at scale with TokenSpeed! 🚀 Light on latency, big on speed. Kudos to…

DịchMô hình Qwen3.8 với 2.4 nghìn tỷ tham số đã được tối ưu hóa thông qua công cụ TokenSpeed, giúp tăng tốc độ xử lý hơn 30% so với phương pháp TP16 truyền thống nhờ kỹ thuật giải mã suy đoán DSpark và tối ưu hóa CUDA graph.

Yuchen Jin@Yuchenj_UW
Mô hìnhĐiểm AI 44/100

Mô hình AI nhỏ mã nguồn mở đang trỗi dậy, trọng tâm ngành công nghệ sắp dịch chuyển

2 things are happening at once: - AI coding models are converging. For 95% of tasks, most people ca…

DịchSự khác biệt giữa các mô hình AI hàng đầu đang dần thu hẹp, trong khi các mô hình nhỏ gọn và mã nguồn mở như GLM-5.3 đang trở nên hiệu quả và phổ biến hơn, báo hiệu một bước ngoặt lớn trong ngành.

14/08

Thứ Sáu · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SKILLER: Học tăng cường ngôn ngữ giúp trích xuất kỹ năng tái sử dụng cho mô hình ngôn ngữ nhỏ

SKILLER giải quyết thách thức trong việc tự động tạo các kỹ năng hiệu quả cho mô hình ngôn ngữ nhỏ, giúp giảm chi phí vận hành tác vụ mà vẫn đảm bảo hiệu suất cao trên phần cứng phổ thông.

13/08

Thứ Năm · 4 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 37/100

Nghiên cứu mới từ Microsoft: Thư viện kỹ năng 'rác' đang làm suy yếu AI Agent như thế nào?

Very interesting new paper from Microsoft and colleagues. (bookmark it) Skill libraries are used i…

DịchNghiên cứu của Microsoft chỉ ra rằng các kỹ năng không cần thiết trong thư viện khiến AI Agent dễ mắc lỗi hoặc giảm hiệu suất do quá trình xác thực dư thừa và quy trình thực thi phức tạp.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

AI4AI: Kỹ thuật Harness giúp mô hình AI yếu đạt hiệu suất vượt trội mà không cần huấn luyện lại

Nghiên cứu mới giới thiệu phương pháp dùng mô hình mạnh để tạo 'harness' hỗ trợ mô hình yếu giải quyết vấn đề phức tạp. Kết quả cho thấy hiệu suất tăng vọt từ 0.49 lên 0.91 nhờ tối ưu hóa quy trình suy luận và định dạng đầu ra.

12/08

Thứ Tư · 4 tin
Francois Chollet@fchollet
Hướng dẫnĐiểm AI 31/100

Expedia nâng cấp lên Keras 3: Tăng tốc huấn luyện 30%, giảm độ trễ 70%

Expedia recently moved its ranking models to a state-of-the-art Keras 3 setup. Results: 30% faster t…

DịchExpedia đã chuyển đổi mô hình xếp hạng lưu trú sang kiến trúc Keras 3, giúp tối ưu hóa hiệu suất vượt trội với tốc độ huấn luyện nhanh hơn 30% và giảm đáng kể độ trễ suy luận.

Tổng 27 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (41 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “tối ưu hóa AI” — Trang 4 | AIHOT.vn