PackLab là khung làm việc mới giúp tối ưu hóa khả năng ra quyết định tuần tự của các mô hình MLLM trong tác vụ xếp hàng hóa bằng robot, thông qua nền tảng mô phỏng vật lý và bộ công cụ đánh giá chuyên sâu.
Nghiên cứu giới thiệu HEAL, một kỹ thuật phân tách và hiệu chỉnh thông tin ở cấp độ đầu chú ý (attention head) để ngăn chặn ảo giác trong MLLM bằng cách can thiệp vào sự lệch lạc phân phối thông tin.
VA-Bench là bộ tiêu chuẩn mới đánh giá khả năng 'quan sát-suy luận-hành động-điều chỉnh' của mô hình đa phương thức (MLLM) trong môi trường robot, nơi mô hình tự học từ video RGB và điều khiển hành động thực tế.
Vision-RL2 sử dụng học tăng cường cấp vùng để tối ưu hóa mạng đề xuất khu vực trong MLLM mà không cần nhãn dữ liệu, giúp cải thiện độ chính xác vượt trội với số lượng token thị giác ít hơn gấp 4 lần.
OmniHarness là khung làm việc mới giúp cải thiện khả năng tạo ảnh đa năng bằng cách chuyển đổi các quy trình thực thi thành chính sách biểu tượng có thể tái sử dụng, giúp hệ thống tự học và thích nghi với các tác vụ mới hiệu quả hơn.
HarnessVLN là khung làm việc zero-shot giúp robot điều hướng dựa trên ngôn ngữ mà không cần huấn luyện, sử dụng cơ chế Agent Harness để phối hợp nhận thức, lập kế hoạch và xử lý lỗi thông qua giao diện công cụ thống nhất.
Nghiên cứu giới thiệu khung 'Exploration-Guided Prompt Scaffolding' giúp tối ưu hóa hậu huấn luyện RL cho mô hình đa phương thức (MLLM) thông qua chỉ số EPS, giúp đánh giá tiềm năng khám phá mà không tốn thêm chi phí tính toán.
ReactHuman là bộ tiêu chuẩn đầu tiên đánh giá khả năng phản ứng tức thời của các mô hình đa phương thức (MLLM) trước các tình huống nguy hiểm trong môi trường gia đình, giúp robot đưa ra quyết định an toàn và chính xác hơn.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc đưa AI vào đời sống thực tế, giải quyết khoảng trống giữa hiểu biết vật lý lý thuyết và phản xạ an toàn trong robot học.
VDiff-Bench là bộ tiêu chuẩn mới gồm 1.756 câu hỏi trắc nghiệm, giúp kiểm tra khả năng phát hiện các thay đổi tinh vi giữa hai hình ảnh của các mô hình ngôn ngữ đa phương thức (MLLM) vốn thường gặp khó khăn trong tác vụ này.
ShallowStream là khung làm việc mới giúp giảm chi phí tính toán khi xử lý video trực tuyến bằng cách kết hợp xử lý nông (shallow) cho các khung hình đầu vào và chỉ đi sâu (deep) khi cần thiết, giúp tối ưu hóa bộ nhớ KV cache.
LatentStream thay đổi cách xử lý video từ lưu trữ truyền thống sang nội hóa dữ liệu, giúp AI suy luận chính xác trong môi trường bộ nhớ hạn chế. Phương pháp này thiết lập chuẩn mực mới (SOTA) trên các bộ dữ liệu video trực tuyến và ngoại tuyến.
KBMR giải quyết hạn chế của các mô hình CLIP truyền thống bằng cách sử dụng MLLM để ánh xạ hình ảnh vào không gian ngữ nghĩa, giúp nhận diện thực thể chính xác hơn trong các tác vụ VQA đòi hỏi kiến thức chuyên sâu.
Nghiên cứu giới thiệu kiến trúc DroneCATS, tích hợp trực tiếp mô hình đa phương thức vào hệ thống điều khiển drone để thực hiện các nhiệm vụ phức tạp như bám đuổi và tìm kiếm mà không cần tinh chỉnh. Kết quả cho thấy dù khả năng nhận diện không gian tốt, các mô hình vẫn gặp khó khăn trong việc duy trì giao thức hành động và xác định thời điểm kết thúc nhiệm vụ.
PonderPounce kết hợp mô hình MLLM 'Ponder' để suy luận ngữ cảnh và VLA 'Pounce' để thực thi hành động, giúp robot ghi nhớ lịch sử và đưa ra quyết định thông minh hơn mà không cần cơ chế bộ nhớ riêng biệt.
UrbanGround là sandbox đầu tiên dựa trên dữ liệu 3D toàn cảnh Hong Kong, cho phép kiểm thử khả năng điều hướng và nhận thức của các mô hình MLLM trong môi trường đô thị thực tế. Kết quả cho thấy AI hiện nay vẫn gặp khó khăn trong việc duy trì định hướng và lập kế hoạch dài hạn.
Aphanta là khung chẩn đoán tự động giúp đánh giá và cải thiện hiệu quả của các công cụ chỉnh sửa ảnh trong quy trình suy luận đa phương thức, giúp tăng đáng kể độ chính xác của các tác vụ phức tạp.
Video-IFBench là bộ tiêu chuẩn đánh giá chuyên sâu khả năng tuân thủ chỉ dẫn của các mô hình đa phương thức (MLLM) khi xử lý video, thông qua 1.500 mẫu thử nghiệm với độ phức tạp cao. Kết quả cho thấy các mô hình hiện nay vẫn gặp khó khăn lớn với các yêu cầu đa ràng buộc và cấu trúc phức tạp.
Nghiên cứu giới thiệu OraRL, phương pháp mới tận dụng dữ liệu chú giải làm 'oracle rollout' để cải thiện hiệu suất học tăng cường cho mô hình MLLM video, giải quyết vấn đề đảo ngược lợi thế trong quá trình huấn luyện.
Nghiên cứu giới thiệu PatternEval, bộ tiêu chuẩn chẩn đoán mới nhằm đảm bảo tính nhất quán trong hành vi phản hồi giữa chế độ tư duy sâu và suy luận nhanh của các mô hình MLLM, giúp khắc phục các lỗi logic và định dạng thường gặp.
VideoGAIA nâng tầm đánh giá AI từ việc trả lời câu hỏi đơn thuần sang tương tác đa lượt, yêu cầu mô hình phải sử dụng công cụ và tổng hợp thông tin từ video một cách thông minh.
MMDiff là khung làm việc mới giúp giải mã và kiểm soát các đặc trưng bên trong của mô hình ngôn ngữ đa phương thức (MLLM) thông qua kỹ thuật so sánh mô hình, hỗ trợ cô lập tính năng và điều chỉnh hành vi mô hình hiệu quả hơn.
GAS là khung huấn luyện mới sử dụng việc tạo sinh hình ảnh làm giám sát phụ để cải thiện khả năng hiểu thị giác của các mô hình ngôn ngữ đa phương thức mà không làm tăng chi phí suy luận.
Nghiên cứu đề xuất phương pháp dùng LLM để tự động thiết kế thuật toán cắt tỉa token hình ảnh, giúp giảm chi phí tính toán cho các mô hình đa phương thức mà không cần tinh chỉnh thủ công.