Training Object Permanence in World Models paper: https://huggingface.co/papers/2609.28654
DịchBài báo khoa học này khám phá phương pháp huấn luyện giúp các mô hình thế giới (world models) hiểu được khái niệm duy trì đối tượng, ngay cả khi vật thể bị che khuất khỏi tầm nhìn.
Nghiên cứu giới thiệu WROP, bộ dữ liệu gồm 1,5 triệu mẫu mô phỏng nhằm huấn luyện và đánh giá khả năng nhận thức vật lý của 14 mô hình video, tập trung vào khái niệm duy trì vật thể (object permanence) giống con người.
Vì sao đáng đọc: Đề tài nghiên cứu chuyên sâu, giải quyết vấn đề cốt lõi trong việc phát triển trí tuệ nhân tạo có khả năng hiểu vật lý thế giới thực, rất có giá trị cho cộng đồng AI.
HappyWorld-Bench là bộ benchmark toàn diện đầu tiên đánh giá độ tin cậy của các mô hình thế giới thông qua khả năng tương tác, khám phá và thay đổi môi trường trên ba nền tảng: video, không gian và thực thể.
Được vinh danh tại CoRL 2026, mô hình World Synesthesia (WSM) tích hợp thị giác, xúc giác và cảm giác bản thể để giúp bàn tay robot 22 bậc tự do xử lý nhiễu cảm biến và ngoại lực, cho phép thao tác vật thể ổn định ngay cả với các vật thể chưa từng gặp.
Vì sao đáng đọc: Nghiên cứu giải quyết bài toán hóc búa về tính ổn định của robot linh hoạt trong môi trường thực tế, có mã nguồn mở và được công nhận tại hội nghị hàng đầu CoRL.
DịchDự án Odyssey vừa thông báo sẽ công bố phần tiếp theo trong loạt mô hình thế giới (world models) của họ vào ngày mai, hứa hẹn mang đến những bước tiến mới trong lĩnh vực mô phỏng AI.
OpenWAM giới thiệu một nền tảng nghiên cứu mở giúp tách biệt các thành phần trong mô hình Thế giới - Hành động (WAM), cho phép thử nghiệm có kiểm soát để hiểu rõ cách thức tri thức từ video chuyển hóa thành tín hiệu điều khiển cho robot.
HiDream.ai giới thiệu DreamWorld, mô hình khuếch tán video sử dụng tiền đề hình học 3D để giải quyết tình trạng biến dạng vật thể và thiếu nhất quán khi thay đổi góc quay, giúp tạo ra thế giới ảo ổn định hơn.
Vì sao đáng đọc: Nghiên cứu quan trọng được ECCV chấp nhận, giải quyết bài toán khó về tính nhất quán 3D trong tạo video, có tính ứng dụng cao cho mô hình thế giới (World Models).
Phương pháp Latent Dynamics Reasoning (LDR) cải thiện độ chính xác vật lý cho mô hình video bằng cách tích hợp các quy luật chuyển động thay vì chỉ khớp pixel, giúp dự đoán các kịch bản ngoài phân phối tốt hơn.