On the Diffusibility of High-Dimensional Latents paper: https://huggingface.co/papers/2609.28473
DịchBài báo khoa học này đi sâu phân tích cơ chế và tính khả thi của việc áp dụng mô hình khuếch tán (diffusion) trên các không gian biến tiềm ẩn có số chiều lớn, mở ra hướng đi mới cho việc tối ưu hóa kiến trúc mô hình tạo sinh.
Uranus là trình mô phỏng robot dựa trên dữ liệu, sử dụng mô hình khuếch tán tự hồi quy để tạo video RGB đa góc nhìn theo thời gian thực với tốc độ 24 FPS, hỗ trợ linh hoạt nhiều cấu hình robot mà không giới hạn thời lượng.
SVEET là khung chỉnh sửa video trực tuyến chất lượng cao, tận dụng mô hình khuếch tán hai chiều với cơ chế tách biệt đặc trưng. Phương pháp này đạt tốc độ 15 FPS trên một GPU H100 mà không cần tăng tốc bổ sung, cho phép chỉnh sửa video thời gian thực hiệu quả.
Video DeltaNet (VDN) kết hợp cơ chế chú ý Softmax cục bộ với bộ nhớ tuyến tính hai chiều, giúp tối ưu hóa việc mô hình hóa không gian và duy trì ngữ cảnh video dài cho các ứng dụng livestream.
Nghiên cứu giới thiệu phương pháp dùng các 'register tokens' để lưu trữ trạng thái suy luận, giúp mô hình ngôn ngữ khuếch tán duy trì logic mạch lạc khi xử lý văn bản dài mà không cần giữ toàn bộ ngữ cảnh cũ.
Apple giới thiệu DACA-GRPO, phương pháp mới giúp cải thiện việc phân bổ tín dụng trong học tăng cường cho mô hình ngôn ngữ khuếch tán thông qua kỹ thuật đánh giá tiến trình khử nhiễu và giảm sai lệch ước tính.
Dynin-Robotics sử dụng mô hình khuếch tán đa phương thức để dự đoán mục tiêu và động lực học, giúp robot thực hiện hành động chính xác hơn thông qua việc hiểu ngôn ngữ và quan sát hình ảnh.
Attention-DP3 cải thiện khả năng thao tác robot trong môi trường phức tạp bằng cách tích hợp thông tin hình học cấp vật thể vào mô hình khuếch tán 3D, giúp robot định vị mục tiêu chính xác hơn ngay cả khi bị che khuất.
TransNormal-2 giải quyết lỗi tái tạo của VAE trong ước tính bề mặt 3D bằng cách tối ưu hóa giám sát tiềm ẩn và hiệu chỉnh cạnh, giúp tăng độ chính xác hình học đáng kể cho các mô hình khuếch tán.
Phương pháp Mask Forcing giúp khắc phục tình trạng video bị bão hòa hoặc mờ nhòe trong các mô hình khuếch tán tự hồi quy bằng cách chèn các lớp mặt nạ ngẫu nhiên. Kỹ thuật này cải thiện đáng kể chất lượng hình ảnh mà không cần dữ liệu thực tế hay bước hậu huấn luyện phức tạp.
Unlocking Lossless Speedups in LLMs via Discrete Diffusion paper: https://huggingface.co/papers/260...
DịchNghiên cứu mới giới thiệu phương pháp sử dụng mô hình khuếch tán rời rạc (discrete diffusion) để tăng tốc độ xử lý cho các mô hình ngôn ngữ lớn mà vẫn đảm bảo độ chính xác tuyệt đối.
Mercury 2.5 from @_inception_ai is now generally available on OpenRouter. It's the fastest model on…
DịchMercury 2.5, mô hình ngôn ngữ sử dụng cơ chế khuếch tán để giải mã token song song, hiện đã khả dụng trên OpenRouter. Đây là mô hình nhanh nhất trên nền tảng này mà không yêu cầu phần cứng chuyên dụng, đặc biệt tối ưu cho các tác vụ lập trình.
Uno shows a simple way to speed up existing LLMs without changing their output distribution: keep th…
DịchUno tối ưu hóa suy luận LLM bằng cách sử dụng mô hình khuếch tán để dự đoán song song nhiều token mà không làm thay đổi chất lượng đầu ra. Phương pháp này giúp tăng thông lượng lên tới 2,5 lần và đẩy nhanh quá trình huấn luyện RL tới 40% trên mô hình Qwen3-8B.
Duliffusion models are evolving 👀 Inception launched Mercury 2.5 diffusion model and it performs o…
DịchInception vừa trình làng Mercury 2.5, phiên bản nâng cấp với khả năng xử lý thông minh vượt trội 40% so với thế hệ trước, đồng thời đạt tốc độ ấn tượng 1107 tokens/giây trên các dòng GPU NVIDIA phổ biến.
Nghiên cứu phân tích cơ chế 'tam giác chú ý' trong các mô hình khuếch tán, chỉ ra cách thông tin ngữ nghĩa bị rò rỉ giữa âm thanh và hình ảnh, dẫn đến các kết quả sai lệch so với yêu cầu người dùng.
This work introduces diffusion-augmented LLMs, a new class of models. They first suggest that specu…
DịchNghiên cứu mới giới thiệu Uno, mô hình kết hợp khuếch tán vào LLM tự hồi quy để dự đoán nhiều token cùng lúc mà không làm giảm độ chính xác, giúp tăng tốc độ tạo văn bản gấp 3 lần.
Mô hình ngôn ngữ khuếch tán (dLLM) đang nổi lên như giải pháp thay thế cho mô hình tự hồi quy truyền thống, cho phép tạo nội dung song song thay vì từng từ, giúp tăng tốc độ xử lý cho AI Agent lên gấp 5 lần trên thiết bị đầu cuối.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giải quyết nút thắt về độ trễ của AI Agent. Thông tin mang tính thời sự cao, có tiềm năng thay đổi cách vận hành của các mô hình ngôn ngữ lớn trong tương lai.
Nghiên cứu giới thiệu phương pháp GSSC sử dụng khuếch tán rời rạc để tái tạo bản đồ ngữ nghĩa 3D dày đặc từ dữ liệu LiDAR thưa thớt, giải quyết hiệu quả bài toán mất cân bằng dữ liệu nghiêm trọng trong môi trường ngoài trời.
Sau thời gian dài bị lu mờ bởi các mô hình tự hồi quy, CDLM đang hồi sinh nhờ những đột phá mới trong việc xử lý dữ liệu rời rạc bằng không gian nhúng liên tục, hứa hẹn thay đổi cuộc chơi trong lĩnh vực tạo sinh ngôn ngữ.
Stream4D giải quyết vấn đề trôi dạt hình học trong tạo video dài bằng cách thay thế bộ đánh giá tĩnh bằng cơ chế tái tạo 4D, giúp mô hình hiểu rõ động lực học của cảnh quay thay vì chỉ dự đoán khung hình cục bộ.
DiffusionOPSD tối ưu hóa mô hình khuếch tán bằng cách chuyển đổi phần thưởng hình ảnh thành mục tiêu dự đoán trực tiếp, giúp cải thiện đáng kể hiệu suất và giảm tới 63% thời gian huấn luyện so với các phương pháp hiện có.
Nghiên cứu giới thiệu Entropy-Valley, phương pháp chọn độ dài câu đích không cần huấn luyện cho mô hình dịch máy khuếch tán, giúp cải thiện đáng kể chất lượng dịch thuật bằng cách chọn độ dài tối ưu dựa trên độ bất định dự đoán.
Startup SigmaZ AI vừa gọi vốn thành công hàng triệu USD nhằm thúc đẩy công nghệ tạo video tương tác thời gian thực dựa trên mô hình khuếch tán (Diffusion Models).
EditBridge tối ưu hóa việc chỉnh sửa ảnh độ phân giải cao bằng cách chuyển đổi từ bản thấp phân giải, giúp giữ trọn chi tiết gốc. Công nghệ này tăng tốc xử lý lên đến 8,4 lần, cho phép chỉnh sửa ảnh 4K chỉ trong 61 giây.
Các nhà nghiên cứu từ Đại học Phúc Đán và Yinwang giới thiệu WAM-Diff2, khung mô hình VLA giúp chuyển đổi từ kiến trúc tự hồi quy sang khuếch tán, tăng tốc độ giải mã lên 15,1 lần mà vẫn giữ nguyên hiệu suất đa nhiệm.
Vì sao đáng đọc: Nghiên cứu giải quyết trực tiếp bài toán độ trễ trong xe tự lái bằng cách kết hợp ưu điểm của mô hình khuếch tán và tự hồi quy, có tính ứng dụng thực tiễn cao.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứu của Abra chỉ ra rằng mô hình khuếch tán có tính dự báo cao tương tự LLM, nhưng đòi hỏi lượng dữ liệu gấp 10 lần so với công thức Chinchilla để đạt hiệu suất tối ưu.
Nghiên cứu đề xuất chiến lược huấn luyện mới bằng cách tận dụng tiền đề từ không gian tiềm ẩn (latent) trước khi chuyển sang không gian pixel, giúp mô hình đạt hiệu suất vượt trội và tăng tốc độ suy luận đáng kể so với các phương pháp truyền thống.
It has been a bit surprising, to say the least, how powerful LLMs for code have turned out to be in …
DịchKhả năng lập trình vượt trội của LLM đang mở ra những tiềm năng mới, dự báo sẽ tiếp tục dẫn đầu và lấn lướt các mô hình khuếch tán trong tương lai gần.
ReRound sử dụng mô hình khuếch tán để tái tạo trọng số, giúp xác định chính xác hướng làm tròn cho các giá trị nằm gần điểm giữa của khoảng lượng tử hóa, từ đó tối ưu hóa hiệu suất LLM ở mức bit thấp.
Nghiên cứu giới thiệu Simplax, một phương pháp tăng cường Dirichlet-categorical giúp cải thiện hiệu suất của các mô hình khuếch tán rời rạc bằng cách kết hợp biến phụ trợ dạng đơn hình, từ đó nâng cao chất lượng tạo văn bản.
S2R là khung làm việc toàn diện đầu tiên kết hợp mô phỏng vật lý, khử phản chiếu video bằng mô hình khuếch tán và bộ tiêu chuẩn đánh giá mới, giúp khôi phục video sắc nét chỉ với một bước khử nhiễu.
Nghiên cứu giới thiệu phương pháp tái tạo cấu trúc và hình học của vật thể chuyển động chỉ từ một trạng thái tĩnh duy nhất, thay vì cần nhiều dữ liệu chuyển động như trước đây. Hệ thống sử dụng mô hình khuếch tán video để giả lập các khớp nối, giúp tạo ra bản sao số chính xác và nhất quán.