Tất cả chủ đề
CHỦ ĐỀ

Đa phương thức

Khả năng xử lý ngoài văn bản: Hiểu thị giác, đồ họa, âm thanh và video của các mô hình thế hệ mới.

726 bài thu thập75 tinh chọncập nhật đến 27/09 23:50

Tiêu điểm gần đây

14 ngày qua, xếp theo số nguồn độc lập cùng đưa tin
  1. Step 5 Preview: Bước tiến mới từ StepFun với mô hình mã nguồn mở 600B tham số12 nguồn · 20-09
  2. Alibaba ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức gốc với cửa sổ ngữ cảnh 1 triệu token8 nguồn · 19-09
  3. Xiaomi mã nguồn mở dòng mô hình MiMo-V2.6 sau khi tối ưu hóa học tăng cường5 nguồn · 22-09
  4. Meituan ra mắt LongCat-2.5-Preview: 1.6T tham số, cửa sổ ngữ cảnh 1M token và đa phương thức gốc4 nguồn · 26-09
  5. Mô hình Qwen-Image-2.1 chính thức có mặt trên Hugging Face3 nguồn · 20-09

Hôm qua · 27/09

Chủ Nhật · 2 tin
JiQiZhiXin
Điểm AI 92/100

CoRL 2026: LIFT giúp mô hình VLA 'cảm nhận' lực mà không cần dữ liệu tiền huấn luyện

Nhóm nghiên cứu từ ĐH Giao thông Thượng Hải giới thiệu LIFT, phương pháp cho phép mô hình VLA học cách phản ứng với lực thông qua hậu huấn luyện trực tuyến, giúp cải thiện đáng kể hiệu suất thao tác vật lý mà không làm mất đi kiến thức thị giác sẵn có.


Vì sao đáng đọc: Đột phá quan trọng trong robot học, giải quyết bài toán thiếu dữ liệu lực bằng cách tối ưu hóa hậu huấn luyện, được hội nghị CoRL 2026 uy tín công nhận.
JiQiZhiXin
Điểm AI 92/100

Từ Computer-Use đến Robot-Use: Show-Harness giúp VLM điều khiển trực tiếp robot thực tế

Show-Harness giới thiệu một bộ giao diện chuẩn hóa, cho phép các mô hình ngôn ngữ thị giác (VLM) điều khiển robot trong thế giới thực mà không cần tinh chỉnh phức tạp, thu hẹp khoảng cách giữa trí tuệ số và hành động vật lý.


Vì sao đáng đọc: Đề tài (Embodied AI) đang là xu hướng nóng. Bài báo cung cấp giải pháp thực tiễn, mã nguồn mở và dữ liệu đầy đủ, có giá trị cao cho cộng đồng nghiên cứu robot.

26/09

Thứ Bảy · 1 tin
JiQiZhiXin
Điểm AI 88/100

V-Rubrics: Tối ưu hóa học tăng cường đa phương thức với 350.000 tiêu chí đánh giá chi tiết

V-Rubrics giải quyết vấn đề 'phân bổ tín dụng' trong mô hình đa phương thức bằng cách chia nhỏ đánh giá thành các tiêu chí chi tiết, giúp mô hình học từ cả những suy luận đúng ngay cả khi kết quả cuối cùng sai.


Vì sao đáng đọc: Nghiên cứu quan trọng được chấp nhận tại EMNLP 2026, giải quyết bài toán hóc búa trong huấn luyện mô hình đa phương thức bằng phương pháp đánh giá phân đoạn sáng tạo.

25/09

Thứ Sáu · 1 tin
JiQiZhiXin
Điểm AI 92/100

ULTRA: Bước tiến mới giúp robot hình người tự vận hành dựa trên mục tiêu, ứng viên giải thưởng IROS 2026

ULTRA là khung điều khiển đa phương thức thống nhất cho phép robot hình người như Unitree G1 thực hiện các thao tác phức tạp chỉ với mục tiêu đích, thay vì cần hướng dẫn chi tiết từng khung hình, giúp tối ưu hóa khả năng phối hợp toàn thân.


Vì sao đáng đọc: Nghiên cứu đột phá về điều khiển robot hình người, được đề cử giải thưởng tại hội nghị uy tín IROS 2026, có tính ứng dụng cao trong thực tế.

24/09

Thứ Năm · 1 tin
Latent Space
Điểm AI 92/100

Meta Connect 2026: Kính Muse, đột phá về giọng nói, video và trợ lý Charm

Đội ngũ của Mark Zuckerberg tiếp tục gây bão với hàng loạt công nghệ mới tại Meta Connect 2026, từ kính thông minh Muse đến các tính năng AI đa phương thức đầy ấn tượng.


Vì sao đáng đọc: Sự kiện quan trọng của một ông lớn công nghệ, định hình xu hướng phần cứng kết hợp AI trong tương lai gần. Nội dung mang tính thời sự cao và có sức ảnh hưởng lớn.

22/09

Thứ Ba · 5 tin
Hugging Face Daily Papers
Điểm AI 88/100

TAPe+ML: Kiến trúc thị giác máy tính siêu gọn nhẹ cho đa tác vụ

TAPe+ML v3 là hệ thống thị giác máy tính đột phá với chưa đầy 100.000 tham số, sử dụng lý thuyết nhận thức chủ động để xử lý hiệu quả các tác vụ phân loại, phát hiện vật thể và phân đoạn ảnh với độ chính xác ấn tượng.


Vì sao đáng đọc: Đột phá về hiệu suất khi đạt kết quả cao với số lượng tham số cực nhỏ, mở ra tiềm năng ứng dụng AI trên các thiết bị biên hạn chế tài nguyên.
JiQiZhiXin
Điểm AI 92/100

Kỷ nguyên mới của AI tạo sinh: Đại học Fudan và Wan công bố tổng quan đầu tiên về Agentic Visual Generation

Nhóm nghiên cứu từ Fudan, Wan và CUHK đã công bố bài tổng quan toàn diện về Agentic Visual Generation, thiết lập khung phân loại mới cho các hệ thống AI có khả năng tự ra quyết định, chỉnh sửa và học hỏi kinh nghiệm trong quá trình tạo nội dung thị giác.


Vì sao đáng đọc: Đây là bài tổng quan hệ thống đầu tiên về một hướng đi quan trọng trong AI. Nội dung mang tính học thuật cao, có khung phân loại rõ ràng, rất hữu ích cho giới nghiên cứu và phát triển.
Hugging Face Daily Papers
Điểm AI 92/100

Grounded Action Model: Đưa nhận thức không gian 3D vào nền tảng điều khiển robot

Grounded Action Model (GAM) là mô hình robot mới giúp máy móc hiểu rõ vị trí và hình học 3D của vật thể thay vì chỉ học ngầm định từ dữ liệu, giúp việc điều khiển chính xác và hiệu quả hơn thông qua các lệnh ngôn ngữ hoặc hình ảnh.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong robotics, giải quyết điểm yếu về nhận thức không gian của các mô hình VLA hiện nay, có tính ứng dụng thực tiễn cao trong tự động hóa.
Hugging Face Daily Papers
Điểm AI 88/100

HuRo: Chuyển đổi video hành động của người thành dữ liệu huấn luyện robot quy mô lớn

HuRo là phương pháp mới giúp chuyển đổi video hành động của con người thành dữ liệu điều khiển robot, tạo ra tập dữ liệu khổng lồ với 630.000 tập mẫu để huấn luyện các mô hình VLA hiệu quả hơn.


Vì sao đáng đọc: Nghiên cứu giải quyết bài toán thiếu hụt dữ liệu robot bằng cách tận dụng kho video con người khổng lồ, có tiềm năng lớn trong việc thúc đẩy khả năng học tập của robot.
JiQiZhiXin
Điểm AI 92/100

ACM Multimedia 2026: ForgeryVCR - Bước tiến mới trong xác thực hình ảnh bằng suy luận thị giác

Các nhà nghiên cứu từ Tencent và Đại học Thâm Quyến giới thiệu ForgeryVCR, một khung tác tử AI giúp chuyển đổi việc xác thực hình ảnh từ mô tả văn bản sang suy luận dựa trên bằng chứng thị giác trực tiếp, giúp phát hiện ảnh giả mạo chính xác hơn.


Vì sao đáng đọc: Nghiên cứu đột phá được chấp nhận tại hội nghị hàng đầu ACM Multimedia 2026, giải quyết vấn đề cấp thiết về xác thực nội dung trong kỷ nguyên AI tạo sinh.

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Điểm AI 92/100

MintAct: Tác nhân thị giác hợp nhất cho mọi môi trường kỹ thuật số

MintAct là dòng mô hình ngôn ngữ-thị giác đa quy mô, có khả năng điều hướng và sử dụng công cụ trên cả di động, máy tính và web với hiệu suất tương đương các chuyên gia riêng biệt.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc tạo ra tác nhân AI đa năng, giải quyết bài toán khó về tính đồng nhất giữa các nền tảng khác nhau với hạ tầng RL quy mô lớn.

20/09

Chủ Nhật · 3 tin
JiQiZhiXin
Điểm AI 92/100

OpenAI đang tự mình định nghĩa lại tương lai của ngành robot

GPT-6 Astra đang gây sốt khi chứng minh khả năng điều khiển robot thực hiện các tác vụ phức tạp chỉ qua quan sát, từ vẽ tranh đến mô phỏng vật lý, cho thấy OpenAI có thể trở thành 'ông trùm' trong lĩnh vực robot.


Vì sao đáng đọc: Tin tức mang tính đột phá về sự kết hợp giữa AI đa phương thức và robot học, có bằng chứng thực tế từ cộng đồng, thu hút sự quan tâm lớn từ giới công nghệ.
JiQiZhiXin
Điểm AI 92/100

VBVR-Pro: Hệ thống huấn luyện và đánh giá toàn diện khả năng suy luận thị giác cho mô hình AI

VBVR-Pro cung cấp bộ 300 tác vụ suy luận thị giác cùng cơ chế chấm điểm tự động, giúp tối ưu hóa khả năng tư duy không gian và logic cho các mô hình đa phương thức thông qua học tăng cường.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng từ các đại học hàng đầu, giải quyết bài toán cốt lõi về khả năng suy luận thị giác thay vì chỉ nhận diện hình ảnh đơn thuần, có tính ứng dụng cao.
WeChat: StepFun (Step)
Điểm AI 66/100

Step 5 Preview: Bước tiến mới từ StepFun với mô hình mã nguồn mở 600B tham số

StepFun vừa ra mắt mô hình flagship Step 5 Preview sử dụng kiến trúc MoE, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và khả năng xử lý đa phương thức. Với hiệu suất vượt trội và chi phí vận hành chỉ bằng 1/8 so với Claude 3 Opus, đây là đối thủ đáng gờm trong nhóm mô hình mã nguồn mở.

Diễn biến sự kiện · 10 bài →Thêm 11 nguồn khác đưa tinX: StepFun (@StepFun_ai)X: Artificial Analysis (@ArtificialAnlys)X: Elvis Saravia (@omarsar0, DAIR.AI)MarkTechPostX: Hongming (@hongming731)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Testing Catalog (@testingcatalog)IT HomeWeChat: Carl AI WattsQbitAIPandaily
Vì sao đáng đọc: Đây là tin tức quan trọng về một mô hình mã nguồn mở hiệu năng cao từ Trung Quốc, có tác động trực tiếp đến cộng đồng phát triển AI nhờ sự cân bằng giữa chi phí và sức mạnh.

18/09

Thứ Sáu · 2 tin
JiQiZhiXin
Điểm AI 92/100

TPAMI 2026: PolaFormer++ nâng tầm cơ chế chú ý tuyến tính với tính toán phân cực và độ nhọn cấp kênh

PolaFormer++ cải tiến cơ chế chú ý tuyến tính bằng cách tối ưu hóa ánh xạ đặc trưng thông qua tính toán phân cực và độ nhọn cấp kênh, giúp đạt hiệu suất vượt trội trên nhiều tác vụ thị giác máy tính.


Vì sao đáng đọc: Nghiên cứu được đăng trên tạp chí uy tín TPAMI, giải quyết bài toán cốt lõi về hiệu suất của Transformer, có mã nguồn mở và tính ứng dụng cao trong xử lý dữ liệu lớn.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 85/100

DeepSeek-V4.1-Flash ra mắt: Mô hình MoE 552B đa phương thức với công nghệ nén KV cache đột phá

DeepSeek vừa trình làng DeepSeek-V4.1-Flash, mô hình MoE đa phương thức 552 tỷ tham số hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token, hiện đã có sẵn trên Hugging Face.

Diễn biến sự kiện · 5 bài →Thêm 1 nguồn khác đưa tinHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Vì sao đáng đọc: Đây là bước tiến lớn về hiệu năng của DeepSeek với khả năng xử lý ngữ cảnh cực dài và tối ưu hóa bộ nhớ, thu hút sự quan tâm lớn từ cộng đồng AI.

17/09

Thứ Năm · 2 tin
JiQiZhiXin
Điểm AI 92/100

ZDTaichu 5.0-9B: Mô hình mã nguồn mở 9B mạnh nhất cho trí tuệ nhân tạo hiện thân

ZDTaichu 5.0-9B thiết lập tiêu chuẩn mới cho các mô hình dưới 10B, dẫn đầu 8/9 bảng xếp hạng về trí tuệ nhân tạo không gian và vượt mặt nhiều đối thủ lớn nhờ công nghệ suy luận vòng lặp thích ứng.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực mô hình nhỏ (SLM) với khả năng ứng dụng thực tế cao trong robot và AI hiện thân, đồng thời cung cấp lộ trình kỹ thuật minh bạch.
Pandaily
Điểm AI 88/100

Light Origins ra mắt mã nguồn mở LightNav-0: Bộ não điều hướng đa năng cho robot

LightNav-0 là mô hình điều hướng dựa trên Qwen3-VL-4B, được huấn luyện qua quy trình Real2Sim2Real với hơn 4.000 giờ dữ liệu VLA, đạt hiệu suất dẫn đầu trên 10 bảng xếp hạng điều hướng đơn thị giác.


Vì sao đáng đọc: Bước tiến quan trọng trong điều hướng robot với khả năng zero-shot ấn tượng, mã nguồn mở giúp thúc đẩy nghiên cứu thực tiễn trong cộng đồng AI.

16/09

Thứ Tư · 2 tin
QbitAI
Điểm AI 88/100

ZDTaichu 5.0-9B: Mô hình AI đa phương thức nội địa Trung Quốc dẫn đầu thế giới về trí tuệ không gian

ZDTaichu 5.0-9B vừa ra mắt đã gây ấn tượng mạnh khi giành vị trí dẫn đầu trong 8/9 bài kiểm tra năng lực không gian, chính thức gia nhập nhóm các mô hình đa phương thức hàng đầu thế giới.


Vì sao đáng đọc: Đây là bước tiến quan trọng của AI nội địa Trung Quốc trong lĩnh vực trí tuệ không gian (embodied AI), với hiệu suất vượt trội so với các mô hình cùng quy mô.
OpenRouter: Announcements
Điểm AI 73/100

DeepSeek V4 nào hỗ trợ nhập liệu hình ảnh? Hướng dẫn chi tiết từ OpenRouter

OpenRouter tổng hợp khả năng hỗ trợ hình ảnh của dòng DeepSeek V4, trong đó phiên bản V4.1 Flash đã hỗ trợ đọc ảnh trực tiếp với chi phí tối ưu từ ngày 10/9/2026.


Vì sao đáng đọc: Thông tin cập nhật kịp thời về khả năng đa phương thức của mô hình DeepSeek, rất hữu ích cho người dùng muốn tối ưu chi phí và công cụ lập trình.

15/09

Thứ Ba · 5 tin
JiQiZhiXin
Điểm AI 92/100

ECCV 2026: REAL - Bước tiến mới giúp robot tự chủ trong thế giới thực mà không cần 'góc nhìn thượng đế'

Nhóm nghiên cứu từ Thượng Hải giới thiệu REAL, khung làm việc cho robot giúp giải quyết các yêu cầu mơ hồ và môi trường chưa biết, cho phép robot chủ động khám phá và tương tác với người dùng thay vì dựa vào dữ liệu hoàn hảo.


Vì sao đáng đọc: Đề tài (Embodied AI) đang là xu hướng nóng. Bài báo giải quyết vấn đề thực tế về sự thiếu hụt thông tin trong môi trường thực, có tính ứng dụng cao và đã được ECCV 2026 chấp nhận.
Hugging Face Daily Papers
Điểm AI 88/100

AlayaVista: Mô hình thế giới video streaming kết hợp toàn cảnh và góc nhìn chi tiết

AlayaVista là mô hình thế giới video mới giúp tách biệt quá trình tiến hóa của bối cảnh toàn cảnh 360 độ với việc tổng hợp hình ảnh góc nhìn chi tiết, cho phép điều khiển camera mượt mà và duy trì độ trung thực cao.


Vì sao đáng đọc: Đột phá trong cách xử lý bối cảnh 360 độ kết hợp với video streaming, giải quyết hiệu quả bài toán đánh đổi giữa tầm nhìn bao quát và độ chi tiết trong mô hình thế giới.
Hugging Face Daily Papers
Điểm AI 88/100

Realtime-Venus: Hệ thống tương tác song công thời gian thực với cơ chế ủy quyền bất đồng bộ

Realtime-Venus là hệ thống tương tác đa phương thức sử dụng mô hình 9B, cho phép duy trì hội thoại liên tục trong khi thực hiện các tác vụ phức tạp ở chế độ nền nhờ cơ chế ủy quyền bất đồng bộ.

Thêm 1 nguồn khác đưa tinAnt Group inclusionAI: GitHub kho mã mới
Vì sao đáng đọc: Bước tiến quan trọng trong việc tối ưu hóa trải nghiệm hội thoại thời gian thực, giải quyết được bài toán xử lý đa nhiệm mà không làm gián đoạn tương tác của người dùng.
MarkTechPost
Điểm AI 87/100

DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh

DeepSeek-V4.1-Flash là mô hình MoE đa phương thức mới với 748B tham số, nổi bật nhờ khả năng xử lý 1 triệu token và giảm dung lượng KV Cache xuống chỉ còn 890 byte mỗi token, tối ưu hiệu suất vượt trội so với các thế hệ trước.

Diễn biến sự kiện · 32 bài →Thêm 5 nguồn khác đưa tinFireworks AI (Web)Baseten Blog kỹ thuật (Web)WeChat: Carl AI WattsX: Tencent WorkBuddy (@WorkBuddy_AI)The Decoder: AI News
Vì sao đáng đọc: Đây là bước tiến lớn về kỹ thuật tối ưu hóa bộ nhớ và hiệu suất suy luận cho mô hình ngôn ngữ lớn, thông tin cực kỳ quan trọng với cộng đồng AI.
Hugging Face Daily Papers
Điểm AI 88/100

ReactHuman: Bộ tiêu chuẩn đánh giá khả năng phản xạ vật lý như con người cho robot AI

ReactHuman là bộ tiêu chuẩn đầu tiên đánh giá khả năng phản ứng tức thời của các mô hình đa phương thức (MLLM) trước các tình huống nguy hiểm trong môi trường gia đình, giúp robot đưa ra quyết định an toàn và chính xác hơn.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc đưa AI vào đời sống thực tế, giải quyết khoảng trống giữa hiểu biết vật lý lý thuyết và phản xạ an toàn trong robot học.

13/09

Chủ Nhật · 1 tin
JiQiZhiXin
Điểm AI 92/100

Tối ưu hóa MiniMax H3 trên vLLM-Omni: Đột phá tốc độ tạo video thời gian thực

Bài viết phân tích cách vLLM-Omni và FastVideo FastH3 giải quyết các nút thắt hệ thống trong MiniMax H3, giúp rút ngắn thời gian tạo video 10 giây xuống dưới 9 giây thông qua tối ưu hóa toàn diện từ DiT đến đóng gói MP4.


Vì sao đáng đọc: Nội dung chuyên sâu về kỹ thuật tối ưu hóa hạ tầng cho mô hình video tạo sinh, giải quyết bài toán thực tế về độ trễ hệ thống, rất có giá trị cho kỹ sư AI.

11/09

Thứ Sáu · 2 tin
JiQiZhiXin
Điểm AI 92/100

Từ GitHub Trending đến ECCV Oral: LingBot-Map định nghĩa lại khả năng ghi nhớ không gian của robot

LingBot-Map là mô hình tái tạo 3D thời gian thực đột phá, cho phép robot ghi nhớ môi trường chỉ với một camera RGB thông thường. Dự án mã nguồn mở này đã thu hút cộng đồng lớn và được vinh danh tại hội nghị ECCV 2026.


Vì sao đáng đọc: Dự án kết hợp hoàn hảo giữa tính ứng dụng thực tế (mã nguồn mở phổ biến) và giá trị học thuật cao (ECCV Oral), là chủ đề rất được quan tâm trong giới AI và robotics.
JiQiZhiXin
Điểm AI 92/100

ECCV 2024 công bố giải thưởng lớn: Nghiên cứu 3D đột phá giành giải Best Paper, Fei-Fei Li nhận giải Cống hiến

Hội nghị ECCV vừa vinh danh nghiên cứu 'Heat Kernel Textures' về biểu diễn bề mặt 3D là bài báo xuất sắc nhất, đồng thời trao giải 'Thời gian kiểm chứng' cho giáo sư Fei-Fei Li vì những đóng góp nền tảng cho thị giác máy tính.


Vì sao đáng đọc: Đây là tin tức quan trọng từ một trong ba hội nghị CV hàng đầu thế giới, cập nhật xu hướng nghiên cứu 3D mới nhất và vinh danh nhân vật tầm cỡ trong ngành AI.

10/09

Thứ Năm · 2 tin
LlamaIndex: Sản phẩm, kỹ thuật và đánh giá
Điểm AI 65/100

LlamaIndex giới thiệu OCR thông minh: Giải pháp cân bằng chi phí và độ chính xác cho tài liệu

LlamaIndex đề xuất quy trình OCR hai bước: dùng công cụ miễn phí để quét sơ bộ, sau đó chỉ dùng mô hình thị giác (VLM) cho các trang quan trọng nhằm tối ưu chi phí và hiệu suất.


Vì sao đáng đọc: Giải pháp thực tế, giải quyết trực tiếp bài toán chi phí cao khi xử lý tài liệu bằng AI, rất hữu ích cho các kỹ sư và doanh nghiệp.
DeepSeek: Nhật ký cập nhật API
Điểm AI 79/100

DeepSeek ra mắt V4.1-Flash: Mô hình đa phương thức nhỏ gọn với giá API siêu rẻ

DeepSeek vừa trình làng V4.1-Flash, phiên bản nhỏ nhất trong dòng kiến trúc mới với khả năng hiểu hình ảnh vượt trội và hiệu suất ấn tượng trên các bài kiểm tra chuyên sâu, đi kèm chính sách giảm giá API.

Diễn biến sự kiện · 4 bài →
Vì sao đáng đọc: Đây là bản cập nhật quan trọng từ một đơn vị dẫn đầu thị trường, mang lại giá trị thực tế cho người dùng thông qua việc tối ưu hóa hiệu năng và chi phí.
Đa phương thức — Chủ Đề AI | AIHOT.vn