Kết quả thử nghiệm trên StationeryBench cho thấy GPT-6 Astra vượt trội hoàn toàn so với MolmoAct2 trong việc điều khiển robot thực hiện các tác vụ phức tạp, đánh dấu bước tiến lớn về khả năng nhận thức không gian của AI.
FactoSR giải quyết hạn chế về tư duy không gian của các mô hình VLM bằng cách phân tách bài toán thành ba yếu tố: mặt phẳng, chiều sâu và tính liên tục thời gian, giúp máy hiểu thế giới 3D tốt hơn.
Nghiên cứu giới thiệu AM-Bench để đánh giá liệu LLM hiểu bố cục không gian hay chỉ đơn thuần là chuyển đổi mô tả thành mã nguồn. Kết quả cho thấy khả năng tư duy không gian thực sự khác biệt đáng kể giữa các mô hình, vượt xa khả năng viết code đơn thuần.
Nghiên cứu giới thiệu bộ dữ liệu GUI-Primitives nhằm kiểm tra khả năng hiểu các mối quan hệ không gian trong giao diện người dùng của các mô hình thị giác-ngôn ngữ, vốn đang gặp khó khăn lớn với độ chính xác dưới 32%.
MindTopo thiết lập chuẩn mực mới để đánh giá cách AI hiểu các mối quan hệ cấu trúc không gian phức tạp, mở ra hướng đi mới giúp cải thiện khả năng lập kế hoạch và tư duy logic cho các mô hình VLM.