Ra mắt LLaDA-Image: Mô hình tạo ảnh mạnh mẽ với công thức huấn luyện hoàn toàn mở
LLaDA-Image là khung làm việc thống nhất kết hợp Diffusion Transformer 6B được huấn luyện từ đầu với mô-đun hiểu ngôn ngữ hình ảnh dựa trên nền tảng LLaDA2.0-Mini.
LLaDA-Image là khung làm việc thống nhất kết hợp Diffusion Transformer 6B được huấn luyện từ đầu với mô-đun hiểu ngôn ngữ hình ảnh dựa trên nền tảng LLaDA2.0-Mini.
NeoMME là kiến trúc bộ mã hóa Transformer hai chiều nhỏ gọn, hỗ trợ đa ngôn ngữ và hình ảnh, giúp tối ưu hóa hiệu suất cho các tác vụ truy xuất tài liệu mà không cần dùng đến các mô hình ngôn ngữ tạo sinh cồng kềnh.
Thêm 1 nguồn khác đưa tinHugging Face: BlogNghiên cứu giới thiệu EASE, phương pháp giúp mô hình đa phương thức không chỉ trả lời đúng mà còn phải 'nhìn' đúng vào vùng dữ liệu bằng chứng trên ảnh, giúp cải thiện đáng kể độ tin cậy của các mô hình VLM.
FoldingAgent là khung tác nhân AI sử dụng mô hình ngôn ngữ thị giác (VLM) để phân tích video và chuyển đổi thành các chương trình gấp giấy tham số hóa, giúp giải quyết sai số trong các thao tác phức tạp.
KBMR giải quyết hạn chế của các mô hình CLIP truyền thống bằng cách sử dụng MLLM để ánh xạ hình ảnh vào không gian ngữ nghĩa, giúp nhận diện thực thể chính xác hơn trong các tác vụ VQA đòi hỏi kiến thức chuyên sâu.
SimLoss tối ưu hóa mô hình ngôn ngữ thị giác bằng cách căn chỉnh biểu diễn ẩn với dữ liệu hình ảnh trực tiếp, giúp mô tả chi tiết vật thể mà không cần tăng độ trễ như các hệ thống đa giai đoạn hiện nay.
Nghiên cứu này xác định bốn yếu tố then chốt để tối ưu hóa khả năng đọc và hiểu văn bản trực tiếp từ điểm ảnh, giúp khắc phục các hạn chế về độ phân giải và khả năng đa ngôn ngữ của các mô hình hiện nay.
Qwen-Drive-1.0 là mô hình nền tảng đầu tiên tích hợp khả năng nhận diện 3D, hỏi đáp thị giác và lập kế hoạch di chuyển cho xe tự lái, dựa trên kiến trúc Qwen3.5-4B mà không cần thay đổi cấu trúc tiền huấn luyện.
Qwen-Drive-1.0 tích hợp khả năng nhận diện 3D, trả lời câu hỏi thị giác và lập kế hoạch di chuyển vào một khung mô hình ngôn ngữ thị giác thống nhất, giúp xe tự lái hiểu môi trường và dự đoán quỹ đạo chính xác hơn.
ZimaBlue là khung huấn luyện đột phá giúp robot học cách điều khiển thông qua việc quan sát video thực tế thay vì chỉ dựa vào dữ liệu hành động đắt đỏ, giúp tăng khả năng thích nghi trong môi trường đa dạng.
Nghiên cứu chỉ ra rằng việc tách biệt nhiệm vụ giúp tránh sự suy giảm hiệu năng khi mô hình đa phương thức vừa hiểu vừa tạo ảnh, đồng thời khẳng định mô hình end-to-end vượt trội hơn so với các hệ thống phân tách truyền thống.
KAIST-VICLab giới thiệu ReFlowSET, khung khớp luồng không gian ẩn giúp tối ưu hóa việc chuyển đổi ảnh SAR sang quang học (EO) bằng cách căn chỉnh đặc trưng mà không làm tăng chi phí suy luận. Phương pháp này đạt kết quả SOTA trên các tập dữ liệu chuẩn và đã công khai mã nguồn.
Nghiên cứu giới thiệu kiến trúc DroneCATS, tích hợp trực tiếp mô hình đa phương thức vào hệ thống điều khiển drone để thực hiện các nhiệm vụ phức tạp như bám đuổi và tìm kiếm mà không cần tinh chỉnh. Kết quả cho thấy dù khả năng nhận diện không gian tốt, các mô hình vẫn gặp khó khăn trong việc duy trì giao thức hành động và xác định thời điểm kết thúc nhiệm vụ.
SpanCalib-VLM kết hợp mô hình tạo sinh và bộ gắn nhãn trình tự để phát hiện chính xác các đoạn văn bản bị ảo giác, giúp tối ưu hóa độ tin cậy và tốc độ xử lý cho các mô hình LVLM.
Nghiên cứu giới thiệu chỉ số DIC giúp định lượng tính nhất quán giữa hình ảnh và phản hồi, từ đó tối ưu hóa quy trình chọn lọc dữ liệu cho các mô hình ngôn ngữ thị giác (VLM).
LightNav-0 là mô hình điều hướng robot nhỏ gọn, tận dụng trí tuệ không gian của VLM mà không cần bộ dự đoán chuyên biệt. Nó đạt hiệu suất SOTA trên 10 môi trường mô phỏng và thể hiện khả năng thích nghi linh hoạt trong thế giới thực.
Nghiên cứu giới thiệu mô hình Image Bundle Composition (IBC), cho phép AI tự động tổng hợp các bộ ảnh có liên kết logic thay vì chỉ tìm kiếm ảnh đơn lẻ, giúp phản ánh đúng ý định tìm kiếm phức tạp của người dùng.
BLARM là phương pháp tiên phong cho phép tạo hoạt ảnh 3D từ video đơn lẻ và lưới vật thể tĩnh mà không cần khung xương hay gắn nhãn phức tạp. Công nghệ này sử dụng các thành phần chuyển động cứng tiềm ẩn để tạo ra chuyển động mượt mà, ổn định và chính xác về mặt hình học.
Lucida là phương pháp mới giúp chuyển đổi cảnh nội thất thực tế thành các tài sản 3D có thể chỉnh sửa riêng biệt. Hệ thống sử dụng quy trình ba bước gồm phân tích, tạo tài sản và dùng VLM để tự động hóa việc sắp xếp vật thể trong môi trường mô phỏng.
DeepSeek vừa phát hành V4-Flash-Vision-Exp trên Hugging Face theo giấy phép MIT, đánh dấu bước tiến đầu tiên của dòng V4 trong việc hỗ trợ xử lý hình ảnh.
Máy Tính (Jiqizhixin) phối hợp cùng Huawei tổ chức đêm tiệc kết nối AI Talent Night trong khuôn khổ hội nghị ECCV 2026 tại Malmö, tạo không gian giao lưu chuyên sâu về công nghệ thị giác máy tính, mô hình thế giới và cơ hội nghề nghiệp cho các nhà nghiên cứu trẻ.
Nghiên cứu giới thiệu phương pháp GSSC sử dụng khuếch tán rời rạc để tái tạo bản đồ ngữ nghĩa 3D dày đặc từ dữ liệu LiDAR thưa thớt, giải quyết hiệu quả bài toán mất cân bằng dữ liệu nghiêm trọng trong môi trường ngoài trời.
DeepSeek vừa phát hành mô hình đa phương thức đầu tiên DeepSeek-V4-Flash-Vision-Exp trên Hugging Face theo giấy phép MIT, cung cấp đầy đủ mã nguồn và tài liệu triển khai cho cộng đồng.
Diễn biến sự kiện · 1 bài →Thêm 1 nguồn khác đưa tinPandailyNghiên cứu giới thiệu Intention Distillation (INDI), kỹ thuật giúp mô hình VLA hiểu rõ mục tiêu ngữ nghĩa đằng sau các hành động thay vì chỉ bắt chước chuyển động, giúp robot thực thi nhiệm vụ chính xác hơn.
GGSS là kỹ thuật can thiệp mới giúp loại bỏ định kiến về chủng tộc hoặc giới tính trong các mô hình VLM tạo sinh bằng cách điều chỉnh các token hình ảnh trên không gian hình cầu mà không làm mất đi đặc tính dữ liệu.
Nghiên cứu giới thiệu Parallel Tube Decoding (PTD), phương pháp giúp định vị đối tượng trong video nhanh chóng bằng cách giải mã song song thay vì tuần tự, loại bỏ độ trễ và lỗi tích lũy so với các mô hình ngôn ngữ đa phương thức hiện nay.
EASEL là bộ tiêu chuẩn đánh giá mới giúp đo lường khả năng điều khiển công cụ chính xác của AI thông qua các tác vụ tái tạo hình ảnh và lập kế hoạch trực quan, khắc phục hạn chế của các bài kiểm tra hiện nay.
ABot-Recon là mô hình tái dựng 3D trực tuyến đột phá, chỉ sử dụng bộ nhớ đệm 11 khung hình gần nhất để duy trì độ ổn định mà không cần bộ nhớ dài hạn phức tạp, giúp tối ưu hóa tài nguyên tính toán cho các video cực dài.
VLAct tối ưu hóa việc huấn luyện mô hình robot bằng cách tập trung vào chất lượng biểu diễn thay vì chỉ tăng quy mô dữ liệu, giúp chuyển đổi các quỹ đạo robot hạn chế thành kiến thức hành động có khả năng ứng dụng linh hoạt trên nhiều nền tảng khác nhau.
GeoNeXt biến bài toán ước tính hình học thành dự đoán khung hình tiếp theo, tận dụng tri thức từ mô hình tạo video để đạt hiệu quả cao mà không cần nhiều dữ liệu gán nhãn.
Xiaobei@frxiaobeiCuộc đối đầu giữa EVIE và PaddleOCR-VL cho thấy xu hướng Document AI đang chuyển dịch từ nhận dạng văn bản thuần túy sang truy xuất dựa trên thị giác, tạo tiền đề cho thế hệ RAG tài liệu mới.
MirroS giới thiệu phương pháp Code-as-World, cho phép tái tạo các cảnh vật lý từ video thực tế thành tệp scene.json có thể thực thi, thông qua quy trình tối ưu hóa bằng tác tử AI.
EditaLive là khung chỉnh sửa video nhân vật dựa trên lệnh điều khiển, tối ưu hóa mô hình Wan-Animate để đạt độ trễ thấp và giữ vững biểu cảm khuôn mặt trong livestream.
Amap (thuộc Alibaba) vừa giới thiệu ABot-Recon, mô hình đột phá có khả năng tái tạo cảnh quan 3D quy mô vạn khung hình chỉ từ 12 khung hình đầu vào mà không cần phụ thuộc vào dữ liệu đường dài.
UrbanGround là sandbox đầu tiên dựa trên dữ liệu 3D toàn cảnh Hong Kong, cho phép kiểm thử khả năng điều hướng và nhận thức của các mô hình MLLM trong môi trường đô thị thực tế. Kết quả cho thấy AI hiện nay vẫn gặp khó khăn trong việc duy trì định hướng và lập kế hoạch dài hạn.
Zero-WAM là mô hình video-hành động cho phép robot thực hiện các tác vụ chưa từng học thông qua việc quan sát video hướng dẫn từ con người, giúp giải quyết bài toán tổng quát hóa trong điều khiển robot.
AK@_akhaliqVGI-Bench Probing Visual Intelligence in Video Generation Models paper: https://huggingface.co/pap...
DịchVGI-Bench là bộ tiêu chuẩn mới giúp đo lường khả năng hiểu và xử lý hình ảnh của các mô hình tạo video hiện nay, cung cấp cái nhìn sâu sắc về trí tuệ thị giác trong AI.

Nghiên cứu giới thiệu bộ dữ liệu GUI-Primitives nhằm kiểm tra khả năng hiểu các mối quan hệ không gian trong giao diện người dùng của các mô hình thị giác-ngôn ngữ, vốn đang gặp khó khăn lớn với độ chính xác dưới 32%.
Cohere giới thiệu Parse 5, mô hình thị giác ngôn ngữ 2.3B tham số giúp chuyển đổi trực tiếp PDF, PPT và ảnh sang định dạng Markdown mà không cần qua bước OCR trung gian.
Zhao Chunxiang@chunxiangaiMột người dùng đã tự phát triển ứng dụng quản lý hầm rượu cá nhân, sử dụng AI để nhận diện nhãn chai qua ảnh và tự động trích xuất thông tin chi tiết về giống nho cũng như nguồn gốc xuất xứ.