Mô hình
Đội ngũ đứng sau π0 tái xuất: Ra mắt trình mô phỏng thế giới thực tế ảo mới
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu Trung Quốc vừa trình làng một trình mô phỏng mới, tạo ra 'thế giới thứ hai' chân thực hơn để huấn luyện robot.
Chính văn · Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
18/08/2026 17:57:40 Nguồn: QbitAI
Kiến tạo một "thế giới thứ hai" chân thực hơn cho robot
Yun Zhong, đưa tin từ Aofeisi
QbitAI | Kênh thông tin chính thức QbitAI
Robot cạy nắp chai bia, bọt trắng trào ra theo miệng chai.

Ngay sau đó, nó nghiêng chai rượu, chất lỏng lướt qua góc dưới bên phải khung hình và được rót ổn định vào ly.

Toàn bộ chuỗi hành động diễn ra trôi chảy, thoạt nhìn không khác gì cảnh quay thực tế, trông rất bình thường.
Nhưng sự thật là — từ khoảnh khắc nắp chai bật ra, sự biến đổi chất lỏng của bọt và rượu, cho đến mọi phản hồi vật lý sau đó, toàn bộ khung hình đều được AI suy luận và tạo ra theo thời gian thực!
Đây chính là tác phẩm mới đầy ấn tượng mà đội ngũ Current Robotics vừa ra mắt:
CurrentWorld-0, một trình mô phỏng thế giới tương tác (Interactive World Simulator).
Đây là lần đầu tiên hệ thống này tích hợp khả năng dự đoán đa thực thể (cross-embodiment), đa góc nhìn và lực-xúc giác vào cùng một nền tảng. Đây cũng là bước tiến tiếp theo của đội ngũ sau mô hình điều khiển tinh vi toàn thân cho robot hình người Curr-0.
Nền tảng kỹ thuật và những người đứng sau đội ngũ kín tiếng này cũng có xuất thân không hề tầm thường —
Nhà sáng lập Zhu Yichen từng là Trưởng bộ phận Trí tuệ hiện thân (Embodied AI) tại Tập đoàn Midea, đã công bố hơn 40 bài báo tại các hội nghị hàng đầu với hơn 5.200 lượt trích dẫn học thuật.

Là một trong những nhà nghiên cứu đầu tiên tại Trung Quốc công bố VLA và mô hình thế giới, ông từng dẫn dắt đội ngũ đề xuất mô hình khuếch tán và mô hình VLA đầu cuối (TinyVLA), mở rộng chiến lược VLA+CoT (DiffusionVLA & DexVLA, công bố tại ICML và CoRL), đồng thời là người tiên phong đề xuất mô hình thế giới dùng để đánh giá chiến lược hiện thân (dWorldEval, bài báo nổi bật tại ICML).
Đáng chú ý, trong bài báo cột mốc π0 của Physical Intelligence, họ đã trích dẫn các công trình TinyVLA và ScaleDP do đội ngũ của Zhu Yichen thực hiện.
△ Nguồn ảnh: Tài liệu tham khảo bài báo π0

Từ các mô hình lớn VLA và dữ liệu dạy kèm từ con người thời kỳ đầu, dần mở rộng sang học tập cho robot toàn thân, những khám phá tiên phong này cuối cùng đã trở thành nền tảng kỹ thuật của Current Robotics.
Đối với trình mô phỏng thế giới tương tác vừa ra mắt, mục tiêu cốt lõi của đội ngũ rất rõ ràng:
Cơ thể và cách quan sát của robot có thể rất khác biệt, nhưng trước khi bước vào thế giới thực, chúng phải được rèn luyện trong cùng một thế giới.
Đánh giá robot, trước hết cần một thế giới không tự ý sửa lỗi cho chiến lược
Mô hình thế giới cho robot có một điểm khởi đầu tự nhiên: mô hình tạo video.
Sau khi được huấn luyện trước quy mô lớn, mô hình đã ghi nhớ nhiều quy luật thị giác và chuyển động: vật thể không tự nhiên biến mất khi bị che khuất, hình dạng không đột ngột thay đổi và chuyển động thường liên tục theo thời gian.
Một thao tác gắp thông thường diễn ra như thế nào, mô hình thực tế đã "xem" rất nhiều lần, điều này tất nhiên là tốt cho việc tạo video.
Tuy nhiên, vô số ví dụ thành công trong dữ liệu huấn luyện robot khiến mô hình quen với quỹ đạo "vươn tay — nắm — nhấc lên". Khi một chiến lược chưa hoàn thiện vươn tay lệch hướng, các tiên nghiệm (prior) từ video đôi khi lại tự động "bù đắp" kết quả theo hướng "thành công".
Cánh tay robot thực tế chưa nắm chắc, nhưng vật thể trong khung hình tạo ra vẫn di chuyển theo tay. Việc thực thi thực tế đã thất bại, nhưng tương lai mà mô hình thế giới đưa ra vẫn hoàn thành nhiệm vụ một cách suôn sẻ.
Khi đưa vào đánh giá robot, kiểu "sửa lỗi" này sẽ trực tiếp làm sai lệch kết quả.
Điều mà Current Robotics từng nghiên cứu trong dWorldEval chính là khả năng kiểm soát hành động (action controllability) của mô hình thế giới: khi hành động thay đổi, thế giới phía sau cũng phải thay đổi theo.
Robot lệch sang trái một chút, vật thể không thể tiếp tục đi theo quỹ đạo cũ; hành động đã thất bại, mô hình cũng không được phép tự ý bù đắp kết quả thành thành công.
Đối với CurrentWorld, đây là yêu cầu cơ bản nhất:
Robot làm thế nào, thế giới thay đổi như thế đó; ngay cả khi làm sai, mô hình cũng không được phép sửa lại kết quả cho nó.
CurrentWorld-0: Tại sao việc đánh giá robot lại cần đa thực thể, đa góc nhìn và lực-xúc giác?
Giả sử cần đánh giá một hành động đơn giản nhất: để robot đẩy chiếc cốc trên bàn về phía trước một chút.
Nếu người thực hiện là robot hai tay cố định, hành động có thể chỉ liên quan đến cánh tay máy; nếu thay bằng robot hai tay có khả năng di chuyển và nâng hạ, khung gầm và cơ cấu nâng cũng có thể tham gia; nếu thay bằng robot hình người, toàn bộ hành động sẽ chuyển sang một hệ thống điều khiển toàn thân khác.
Cùng một câu lệnh "đẩy cốc về phía trước", khi áp dụng cho các robot khác nhau, hành động thực tế nhập vào mô hình đã hoàn toàn khác biệt.
Do đó, CurrentWorld-0 không quy định trước một định dạng hành động bắt buộc cho mọi robot, mà giữ lại Action Subspace (không gian hành động) riêng cho từng thực thể.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.