Đa phương thức
CHỦ ĐỀ · TRANG 2

Đa phương thức

Khả năng xử lý ngoài văn bản: Hiểu thị giác, đồ họa, âm thanh và video của các mô hình thế hệ mới.

726 bài thu thập75 tinh chọncập nhật đến 27/09 23:50

  1. JiQiZhiXinT3 · 15/09 · 19:15

    ECCV 2026: REAL - Bước tiến mới giúp robot tự chủ trong thế giới thực mà không cần 'góc nhìn thượng đế'

    Nhóm nghiên cứu từ Thượng Hải giới thiệu REAL, khung làm việc cho robot giúp giải quyết các yêu cầu mơ hồ và môi trường chưa biết, cho phép robot chủ động khám phá và tương tác với người dùng thay vì dựa vào dữ liệu hoàn hảo.

  2. Hugging Face Daily PapersT3 · 15/09 · 14:00

    AlayaVista: Mô hình thế giới video streaming kết hợp toàn cảnh và góc nhìn chi tiết

    AlayaVista là mô hình thế giới video mới giúp tách biệt quá trình tiến hóa của bối cảnh toàn cảnh 360 độ với việc tổng hợp hình ảnh góc nhìn chi tiết, cho phép điều khiển camera mượt mà và duy trì độ trung thực cao.

  3. Hugging Face Daily PapersT3 · 15/09 · 11:45

    Realtime-Venus: Hệ thống tương tác song công thời gian thực với cơ chế ủy quyền bất đồng bộ

    Realtime-Venus là hệ thống tương tác đa phương thức sử dụng mô hình 9B, cho phép duy trì hội thoại liên tục trong khi thực hiện các tác vụ phức tạp ở chế độ nền nhờ cơ chế ủy quyền bất đồng bộ.

  4. MarkTechPostT3 · 15/09 · 07:36

    DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh

    DeepSeek-V4.1-Flash là mô hình MoE đa phương thức mới với 748B tham số, nổi bật nhờ khả năng xử lý 1 triệu token và giảm dung lượng KV Cache xuống chỉ còn 890 byte mỗi token, tối ưu hiệu suất vượt trội so với các thế hệ trước.

  5. Hugging Face Daily PapersT3 · 15/09 · 06:45

    ReactHuman: Bộ tiêu chuẩn đánh giá khả năng phản xạ vật lý như con người cho robot AI

    ReactHuman là bộ tiêu chuẩn đầu tiên đánh giá khả năng phản ứng tức thời của các mô hình đa phương thức (MLLM) trước các tình huống nguy hiểm trong môi trường gia đình, giúp robot đưa ra quyết định an toàn và chính xác hơn.

  6. JiQiZhiXinCN · 13/09 · 23:00

    Tối ưu hóa MiniMax H3 trên vLLM-Omni: Đột phá tốc độ tạo video thời gian thực

    Bài viết phân tích cách vLLM-Omni và FastVideo FastH3 giải quyết các nút thắt hệ thống trong MiniMax H3, giúp rút ngắn thời gian tạo video 10 giây xuống dưới 9 giây thông qua tối ưu hóa toàn diện từ DiT đến đóng gói MP4.

  7. JiQiZhiXinT6 · 11/09 · 21:00

    Từ GitHub Trending đến ECCV Oral: LingBot-Map định nghĩa lại khả năng ghi nhớ không gian của robot

    LingBot-Map là mô hình tái tạo 3D thời gian thực đột phá, cho phép robot ghi nhớ môi trường chỉ với một camera RGB thông thường. Dự án mã nguồn mở này đã thu hút cộng đồng lớn và được vinh danh tại hội nghị ECCV 2026.

  8. JiQiZhiXinT6 · 11/09 · 02:45

    ECCV 2024 công bố giải thưởng lớn: Nghiên cứu 3D đột phá giành giải Best Paper, Fei-Fei Li nhận giải Cống hiến

    Hội nghị ECCV vừa vinh danh nghiên cứu 'Heat Kernel Textures' về biểu diễn bề mặt 3D là bài báo xuất sắc nhất, đồng thời trao giải 'Thời gian kiểm chứng' cho giáo sư Fei-Fei Li vì những đóng góp nền tảng cho thị giác máy tính.

  9. LlamaIndex: Sản phẩm, kỹ thuật và đánh giáT5 · 10/09 · 23:00

    LlamaIndex giới thiệu OCR thông minh: Giải pháp cân bằng chi phí và độ chính xác cho tài liệu

    LlamaIndex đề xuất quy trình OCR hai bước: dùng công cụ miễn phí để quét sơ bộ, sau đó chỉ dùng mô hình thị giác (VLM) cho các trang quan trọng nhằm tối ưu chi phí và hiệu suất.

  10. DeepSeek: Nhật ký cập nhật APIT5 · 10/09 · 12:58

    DeepSeek ra mắt V4.1-Flash: Mô hình đa phương thức nhỏ gọn với giá API siêu rẻ

    DeepSeek vừa trình làng V4.1-Flash, phiên bản nhỏ nhất trong dòng kiến trúc mới với khả năng hiểu hình ảnh vượt trội và hiệu suất ấn tượng trên các bài kiểm tra chuyên sâu, đi kèm chính sách giảm giá API.

  11. JiQiZhiXinT4 · 09/09 · 00:45

    Giải mã 'trí tuệ không gian' trong GPT-6 Astra: Bí ẩn đằng sau khả năng dựng mô hình 3D

    Nghiên cứu mới về S-Space tiết lộ cách các mô hình đa phương thức xây dựng 'bản đồ không gian' nội tại để hiểu vị trí và tương tác vật thể, dù vẫn còn hạn chế trong việc xoay chuyển góc nhìn.

  12. JiQiZhiXinT3 · 08/09 · 00:45

    Đội ngũ Nhan Thủy Thành ra mắt VoiceMem: Kiến trúc 'Song não' đột phá cho tương lai AI tương tác thời gian thực

    VoiceMem giới thiệu hệ thống bộ nhớ đa phương thức giúp AI không chỉ hiểu ngữ cảnh mà còn ghi nhớ cảm xúc và âm thanh, biến trợ lý ảo thành người bạn đồng hành thực thụ thay vì chỉ là công cụ vô tri.

  13. Hugging Face Daily PapersT2 · 07/09 · 17:15

    TFO: Biến mô hình thị giác-ngôn ngữ (VLM) thành hệ thống hiểu âm thanh mà không cần huấn luyện lại

    TFO là giải pháp plug-and-play cho phép tích hợp khả năng hiểu âm thanh vào các mô hình VLM đóng băng mà không cần thay đổi kiến trúc hay huấn luyện lại, giúp bảo toàn nguyên vẹn năng lực suy luận thị giác ban đầu.

  14. Hugging Face Daily PapersT2 · 07/09 · 10:00

    Motion-Omni: Mô hình đối thoại AI tạo lời nói và cử chỉ toàn thân đồng bộ

    Motion-Omni là khung làm việc end-to-end cho phép mô hình đối thoại tạo ra lời nói cùng cử chỉ cơ thể (mặt, tay, dáng đi) trực tiếp từ trạng thái ẩn, thay vì phải xử lý tách biệt như các phương pháp truyền thống.

  15. JiQiZhiXinCN · 06/09 · 20:15

    StarVLA ra mắt VLAct: Chỉ với 16 GPU, vượt mặt NVIDIA GR00T N1.6 với dữ liệu ít hơn 80%

    Nhóm nghiên cứu StarVLA giới thiệu VLAct, mô hình nền tảng VLM tối ưu hóa khả năng học từ dữ liệu robot, đạt hiệu suất vượt trội trên RoboDojo và RoboCasa dù chỉ dùng 16 GPU và 20% lượng dữ liệu so với các đối thủ.

  16. JiQiZhiXinT7 · 05/09 · 22:15

    VLA-Corrector: Giải pháp 40M tham số giúp robot 'tỉnh táo' hơn khi thực hiện hành động

    Nhóm nghiên cứu từ ĐH Chiết Giang và Alibaba DAMO Academy đã phát triển VLA-Corrector, một mô hình nhẹ giúp robot phát hiện và sửa lỗi kịp thời trong các khoảng mù hành động, thay vì mù quáng thực hiện chuỗi lệnh cũ.

  17. JiQiZhiXinT7 · 05/09 · 14:15

    ECCV 2026: ART - Đột phá giới hạn trong công nghệ chuyển đổi trang điểm kỹ thuật số

    Nghiên cứu từ vivo và các đại học hàng đầu giới thiệu ART, phương pháp mới giúp chuyển đổi chính xác các kiểu trang điểm phức tạp như kim tuyến hay họa tiết nghệ thuật mà vẫn giữ nguyên cấu trúc khuôn mặt và danh tính người dùng.

  18. Hugging Face Daily PapersT7 · 05/09 · 08:30

    RoboTok: Công cụ khai thác dữ liệu từ Internet để huấn luyện robot thao tác khéo léo

    RoboTok là hệ thống đột phá giúp trích xuất các video thao tác của con người từ Internet để huấn luyện robot, giải quyết bài toán thiếu hụt dữ liệu thực tế thông qua không gian chuyển động 3D linh hoạt.

  19. JiQiZhiXinT7 · 05/09 · 00:15

    Meta công bố HumanCLAW: Đưa mô hình nền tảng vào tầng quyết định của robot

    HumanCLAW tách biệt việc ra quyết định cấp cao và điều khiển vận động, giúp đánh giá chính xác khả năng 'trí tuệ hành động' của các mô hình ngôn ngữ thị giác (VLM) trong môi trường vật lý thực tế.

  20. JiQiZhiXinT5 · 03/09 · 17:15

    EASE: Khi mô hình AI trả lời đúng nhưng 'nhìn nhầm' ảnh - Giải pháp từ Đại học Công nghệ Cáp Nhĩ Tân

    Nghiên cứu giới thiệu EASE, phương pháp giúp mô hình đa phương thức không chỉ trả lời đúng mà còn phải 'nhìn' đúng vào vùng dữ liệu bằng chứng trên ảnh, giúp cải thiện đáng kể độ tin cậy của các mô hình VLM.

Đa phương thức — Chủ Đề AI · Trang 2 | AIHOT.vn