So many different kind of AI benchmarks are being released. This one is cool, "Furniture Assembly B…
DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng suy luận không gian của AI thông qua việc phát hiện lỗi lắp ráp nội thất. Điểm số cao nhất đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng, cho thấy sự cải thiện đáng kể trong lĩnh vực vốn là điểm yếu của AI.
Spatial-Interactor là khung huấn luyện mới giúp các mô hình ngôn ngữ thị giác (VLM) hiểu được sự thay đổi trạng thái vật lý thông qua các quỹ đạo tương tác, thay vì chỉ dựa vào các câu hỏi tĩnh truyền thống.
Epoch AI giới thiệu bộ tiêu chuẩn FAB, sử dụng 60 ảnh lắp ráp nội thất để kiểm tra khả năng suy luận không gian của AI. GPT-6 Astra dẫn đầu với 80% độ chính xác, vượt xa Claude Fable 5.1 và Claude Opus 5.
Giám đốc nghiên cứu ứng dụng tại OpenAI khẳng định, với sự ra đời của Astra, AI đã chính thức bắt kịp con người trong lĩnh vực suy luận không gian - một trong những lợi thế cuối cùng của trí tuệ nhân loại.
Hệ thống mới giúp khắc phục điểm yếu về suy luận không gian của các mô hình ngôn ngữ thị giác trong y tế bằng cách phân tách quy trình thành các bước phân tích ngôn ngữ, định vị giải phẫu và tính toán hình học xác định.
SPARGen là khung làm việc đa phương thức thống nhất, giải quyết các bài toán tái dựng 3D, tương ứng mật độ và suy luận không gian bằng cách chuyển đổi chúng thành các tác vụ tạo sinh có điều kiện, giúp tối ưu hóa khả năng biểu diễn không gian.
Spatial Memory Agent (SMA) là khung tự tiến hóa giúp các mô hình VLM đóng băng cải thiện khả năng suy luận không gian thông qua việc đúc kết kinh nghiệm và đánh giá độ tin cậy, đạt hiệu suất vượt trội trên nhiều tiêu chuẩn đánh giá.
A path, a fence, a knot. MindTopo sets a new benchmark for testing how AI understands topological re…
DịchMindTopo thiết lập tiêu chuẩn mới để kiểm tra cách AI nhận diện các mối quan hệ topo phức tạp như đường đi, rào cản và nút thắt, mở ra hướng đi mới cho khả năng suy luận không gian.