Đa phương thức
Khả năng xử lý ngoài văn bản: Hiểu thị giác, đồ họa, âm thanh và video của các mô hình thế hệ mới.
726 bài thu thập75 tinh chọncập nhật đến 27/09 23:50
- Hugging Face Daily PapersT4 · 02/09 · 09:45
Qwen-Drive-1.0: Bước tiến mới của mô hình ngôn ngữ thị giác trong xe tự lái
Qwen-Drive-1.0 tích hợp khả năng nhận diện 3D, trả lời câu hỏi thị giác và lập kế hoạch di chuyển vào một khung mô hình ngôn ngữ thị giác thống nhất, giúp xe tự lái hiểu môi trường và dự đoán quỹ đạo chính xác hơn.
- Hugging Face Daily PapersT4 · 02/09 · 09:45
UI-Venus-2: Bước tiến mới cho tác nhân AI điều khiển giao diện người dùng đa nền tảng
UI-Venus-2 là tác nhân AI đa phương thức thế hệ mới, có khả năng tự động hóa tác vụ trên cả di động, web và máy tính nhờ khung làm việc suy luận-hành động khép kín, giúp thu hẹp khoảng cách từ thử nghiệm đến ứng dụng thực tế.
- Hugging Face Daily PapersT4 · 02/09 · 09:30
ZimaBlue: Bước tiến mới trong huấn luyện mô hình hành động robot từ video quy mô lớn
ZimaBlue là khung huấn luyện đột phá giúp robot học cách điều khiển thông qua việc quan sát video thực tế thay vì chỉ dựa vào dữ liệu hành động đắt đỏ, giúp tăng khả năng thích nghi trong môi trường đa dạng.
- QbitAIT4 · 02/09 · 09:00
Fei-Fei Li công bố mô hình thế giới đa phương thức đầu tiên trên thế giới
Mô hình mới có khả năng tái tạo thế giới 3D chỉ từ một hình ảnh duy nhất, đồng thời hỗ trợ tạo môi trường huấn luyện thực tế cho robot.
- Google DeepMind: BlogT4 · 02/09 · 00:30
Google DeepMind ra mắt tính năng hiểu video thông minh cho Gemini
Google DeepMind cập nhật khả năng xử lý video thông minh cho dòng Gemini Flash, giúp mô hình tự động quét các phân đoạn quan trọng. Công nghệ này giúp giảm 88% lượng token, tiết kiệm 66% chi phí và tăng 7% độ chính xác so với phương pháp xử lý khung hình cố định truyền thống.
- IT HomeT2 · 31/08 · 19:29
DeepSeek ra mắt mô hình đa phương thức mã nguồn mở V4-Flash-Vision-Exp, hiệu năng tiệm cận Opus-4.8
DeepSeek vừa phát hành mô hình đa phương thức đầu tiên DeepSeek-V4-Flash-Vision-Exp trên Hugging Face theo giấy phép MIT, cung cấp đầy đủ mã nguồn và tài liệu triển khai cho cộng đồng.
- JiQiZhiXinT2 · 31/08 · 18:00
Ropedia ra mắt HOMIE Gen2: Chìa khóa mở ra định luật quy mô cho trải nghiệm con người trong AI vật lý
Ropedia giới thiệu hệ thống thu thập dữ liệu đa phương thức HOMIE Gen2, giúp chuyển đổi trải nghiệm thực tế của con người thành dữ liệu huấn luyện quy mô lớn cho robot, nhằm giải quyết bài toán thiếu hụt kinh nghiệm trong lĩnh vực AI vật lý.
- Hugging Face Daily PapersT2 · 31/08 · 09:15
VLAct: Bước tiến mới trong huấn luyện mô hình Robot Vision-Language-Action
VLAct tối ưu hóa việc huấn luyện mô hình robot bằng cách tập trung vào chất lượng biểu diễn thay vì chỉ tăng quy mô dữ liệu, giúp chuyển đổi các quỹ đạo robot hạn chế thành kiến thức hành động có khả năng ứng dụng linh hoạt trên nhiều nền tảng khác nhau.
- JiQiZhiXinT6 · 28/08 · 13:45
ECCV 2026 Oral: MAVIN - Bước tiến mới giúp AI 'đạo diễn' video đa góc quay theo kịch bản
MAVIN là mô hình tiên phong cho phép AI tạo video đa góc quay với khả năng kiểm soát chặt chẽ về thời gian, đồng bộ âm thanh và nhất quán nhân vật, giải quyết bài toán khó trong việc kể chuyện bằng video dài.
- Hugging Face Daily PapersT6 · 28/08 · 09:45
Zero-WAM: Mô hình hóa hành động từ video người để robot thực hiện tác vụ mới
Zero-WAM là mô hình video-hành động cho phép robot thực hiện các tác vụ chưa từng học thông qua việc quan sát video hướng dẫn từ con người, giúp giải quyết bài toán tổng quát hóa trong điều khiển robot.
- Google DeepMind: BlogT5 · 27/08 · 23:12
Google ra mắt Gemini 1.1 Flash: Bước tiến mới trong khả năng kiểm soát video AI
Google giới thiệu Gemini 1.1 Flash với khả năng kiểm soát video nâng cao, hỗ trợ mở rộng bối cảnh lên tới 40 giây, tạo chuyển cảnh mượt mà và xuất video độ phân giải 4K cho nhà phát triển.
- JiQiZhiXinT5 · 27/08 · 19:45
ECCV 2026 | OmniColor: Khung làm việc thống nhất cho tô màu tranh vẽ nét đa phương thức
OmniColor là giải pháp đột phá từ ĐH Bách khoa Hồng Kông, cho phép tô màu tranh vẽ nét dựa trên sự kết hợp linh hoạt giữa văn bản, gợi ý màu sắc, hình ảnh tham chiếu và khung hình lịch sử, giải quyết triệt để vấn đề xung đột điều kiện trong quy trình sản xuất hoạt hình chuyên nghiệp.
- Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web)T5 · 27/08 · 14:10
Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp
Zhipu vừa phát hành GLM-5.3-Flash, mô hình đa phương thức đầu tiên trong dòng GLM-5 với hiệu suất ngang ngửa Claude Opus 4.8 nhưng giá thành chỉ bằng 1/40, đồng thời đánh dấu bước tiến lớn khi vận hành trên hạ tầng chip nội địa.
- PandailyT5 · 27/08 · 10:00
Alibaba ra mắt mã nguồn mở Qwen3.8-Flash: Hiệu suất cao với chi phí huấn luyện chỉ bằng 1/9
Đội ngũ Qwen của Alibaba vừa giới thiệu Qwen3.8-Flash, mô hình đa phương thức MoE thuộc kiến trúc Qwen4 với 6 tỷ tham số kích hoạt, giúp tối ưu hóa đáng kể chi phí huấn luyện so với phiên bản tiền nhiệm.
- JiQiZhiXinT5 · 27/08 · 03:45
Qwen3.8-Flash chính thức ra mắt: Bước tiến đột phá hé lộ hình hài của Qwen4
Trong bối cảnh các ông lớn AI đồng loạt tăng giá API, Alibaba gây ấn tượng khi tung ra Qwen3.8-Flash với hiệu năng vượt trội trong các tác vụ lập trình và đa phương thức, đặt ra tiêu chuẩn mới về sự cân bằng giữa chi phí và sức mạnh xử lý.
- JiQiZhiXinT5 · 27/08 · 01:30
HKUST (Quảng Châu) và Tencent ra mắt VibeWorlding: Kỷ nguyên 'Vibe Coding' cho thế giới 3D
VibeWorlding là khung tác nhân đa phương thức cho phép người dùng xây dựng và chỉnh sửa thế giới 3D tương tác thông qua đối thoại tự nhiên, thay thế quy trình thiết kế thủ công bằng cơ chế tự động hóa thông minh.
- QwenT4 · 26/08 · 22:37
Alibaba ra mắt Qwen3.8-Flash: Mô hình MoE hiệu năng cao, hé lộ kiến trúc Qwen4
Qwen3.8-Flash là mô hình đa phương thức 125B với kiến trúc MoE tối ưu, chỉ kích hoạt 6B tham số mỗi token nhưng vượt trội hoàn toàn so với bản tiền nhiệm. Đây là bước đệm cho kiến trúc Qwen4 với chi phí vận hành cực thấp và hỗ trợ ngữ cảnh lên tới 1 triệu token.
- Hugging Face Daily PapersT3 · 25/08 · 09:30
TLive-Omni: Mô hình đa phương thức chuyên biệt cho livestream thương mại điện tử
TLive-Omni là mô hình AI đột phá giúp phân tích livestream bán hàng bằng cách hợp nhất dữ liệu từ video, âm thanh, hình ảnh và văn bản. Với cơ chế Per-vGrid và kỹ thuật tinh chỉnh Faithful-RFT, mô hình giúp AI hiểu ngữ cảnh và phản hồi chính xác các thông tin sản phẩm trong thời gian thực.
- JiQiZhiXinT2 · 24/08 · 19:30
Đột phá trên Science Robotics: Nhóm nghiên cứu Thanh Hoa mất 22 năm để dạy robot đá bóng
Nhóm nghiên cứu từ Đại học Thanh Hoa đã phát triển khung học tập dựa trên thị giác, giúp robot hình người thực hiện các kỹ năng đá bóng linh hoạt trong môi trường thực tế, đánh dấu cột mốc quan trọng sau 22 năm kiên trì nghiên cứu.
- QbitAIT2 · 24/08 · 12:15
WRC 2026: Mô hình thế giới toàn phương thức nguyên bản – Từ mô phỏng đến tương tác thực tế
Tại WRC 2026, các chuyên gia đã giới thiệu mô hình thế giới toàn phương thức (native omni-modal) thế hệ mới, cho phép AI không chỉ mô phỏng môi trường mà còn tương tác trực tiếp với thế giới thực một cách tự nhiên.