VA-Bench là bộ tiêu chuẩn mới đánh giá khả năng 'quan sát-suy luận-hành động-điều chỉnh' của mô hình đa phương thức (MLLM) trong môi trường robot, nơi mô hình tự học từ video RGB và điều khiển hành động thực tế.
ZDTaichu 5.0-9B vừa ra mắt đã gây ấn tượng mạnh khi giành vị trí dẫn đầu trong 8/9 bài kiểm tra năng lực không gian, chính thức gia nhập nhóm các mô hình đa phương thức hàng đầu thế giới.
Vì sao đáng đọc: Đây là bước tiến quan trọng của AI nội địa Trung Quốc trong lĩnh vực trí tuệ không gian (embodied AI), với hiệu suất vượt trội so với các mô hình cùng quy mô.
PhysBrain 1.5 vừa thiết lập cột mốc mới trong lĩnh vực trí tuệ không gian, khẳng định vị thế ngang hàng với các mô hình tiên tiến như GPT-6 Astra bằng cách giải quyết thành công bài toán vòng lặp vật lý phức tạp.
Vì sao đáng đọc: Tin tức quan trọng về bước tiến công nghệ của Trung Quốc trong lĩnh vực AI vật lý, có tác động lớn đến cộng đồng nghiên cứu và cạnh tranh toàn cầu.
SpatialBlock-15k là tập dữ liệu tổng hợp mới giúp mô hình LVLM cải thiện khả năng hiểu cấu trúc 3D từ ảnh 2D thông qua các bài tập xếp khối, thay thế cho việc gán nhãn hình học thủ công tốn kém.
Nghiên cứu mới về S-Space tiết lộ cách các mô hình đa phương thức xây dựng 'bản đồ không gian' nội tại để hiểu vị trí và tương tác vật thể, dù vẫn còn hạn chế trong việc xoay chuyển góc nhìn.
Vì sao đáng đọc: Bài viết đi sâu vào cơ chế cốt lõi của các mô hình AI thế hệ mới, giải thích hiện tượng 'trí tuệ không gian' bằng góc nhìn kỹ thuật nhưng vẫn dễ hiểu, rất giá trị với người làm AI.
Next view prediction is the key to Atlas, enabling us to unify pixel-level generation and reconstruc…
DịchFei-Fei Li cùng các cộng sự tại World Labs chia sẻ về Atlas, mô hình trí tuệ không gian đột phá giúp dự đoán và tái tạo thế giới thông qua điểm ảnh thống nhất.
Fei-Fei Li cho rằng ngôn ngữ chỉ là dữ liệu nén, trong khi thế giới thực được định hình bởi hình học 3D và vật lý. AI cần trí tuệ không gian để thực sự hiểu thế giới thay vì chỉ học qua văn bản.
World Labs giới thiệu Atlas, mô hình thế giới sử dụng kiến trúc Transformer khuếch tán tự hồi quy, có khả năng xử lý đồng thời văn bản, hình ảnh, video và 3D. Mô hình vượt trội trong việc tạo video có kiểm soát camera và tái tạo 3D, mở ra tiềm năng lớn cho mô phỏng không gian.