‹ Quay lạiTinh chọnĐiểm AI 88/100
QbitAI
Tinh chọnĐiểm AI 88/100

Mô hình

Đột phá mới: Dạy robot làm việc qua video với 120 tỷ token hành động con người

(giờ Việt Nam)

Tóm tắt AI

Các nhà nghiên cứu tận dụng kho dữ liệu video khổng lồ từ internet để huấn luyện robot, giúp sai số giảm dần theo quy luật lũy thừa khi quy mô dữ liệu tăng lên.

Chính văn · Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

23/09/2026 12:25:12 Nguồn: QbitAI

Đặt cược vào kinh nghiệm con người trên Internet

Yun Zhong, đưa tin từ Aofeisi

QbitAI | Kênh chính thức QbitAI

Ngày 17 tháng 9, Figure đã đưa Helix 2.5 vào 30 hộ gia đình xa lạ tại khu vực Vịnh San Francisco. Nhiệm vụ của nó là dọn dẹp đồ chơi vương vãi trong phòng khách, gấp khăn và trải giường. Sau khi robot đến hiện trường, nó không thu thập dữ liệu mới, không cập nhật trọng số mô hình, cũng không chọn lại mô hình dựa trên kết quả thực thi tại chỗ.

Video này rất dễ bị tóm tắt thành "robot hình người làm việc nhà theo kiểu 'zero-shot' (không cần học trước)". Tuy nhiên, nói một cách chính xác thì không phải vậy. Cả ba nhiệm vụ này trước đó đều đã được tinh chỉnh bằng dữ liệu chuyên dụng trong các môi trường khác. "Zero-shot" mà Figure đề cập ở đây có nghĩa là khi robot lần đầu tiên bước vào những ngôi nhà này, đối mặt với bố cục và đối tượng thao tác mới, nó không cần phải huấn luyện lại cho môi trường và vật thể tại địa phương đó.

Lưu ý: Figure Helix 2.5 thực hiện các nhiệm vụ dọn dẹp phòng khách, gấp khăn và trải giường tại 30 hộ gia đình ở khu vực Vịnh, nơi trước đó chưa từng thu thập dữ liệu huấn luyện nhiệm vụ. "Zero-shot" ở đây chỉ việc robot không cần huấn luyện lại tại chỗ khi đối mặt với môi trường gia đình, bố cục không gian và các đối tượng thao tác mới, không có nghĩa là mô hình chưa từng học các nhiệm vụ này trước đó; các nhiệm vụ liên quan đã được hoàn thiện thông qua dữ liệu thu thập từ các môi trường khác. Nguồn: Figure

Ngoài video, Figure còn công bố hai nhóm thí nghiệm khác dễ bị bỏ qua hơn.

Nhóm thứ nhất so sánh trực tiếp việc có trải qua quá trình tiền huấn luyện Index hay không.

Figure đã sử dụng cùng một lô dữ liệu chuyên biệt cho nhiệm vụ để huấn luyện hai bộ mô hình chiến lược, với kiến trúc, phương pháp tối ưu hóa, siêu tham số, dữ liệu hạ nguồn và phương pháp đánh giá được giữ nguyên. Một bộ được khởi tạo ngẫu nhiên, bộ còn lại bắt đầu từ mô hình tiền huấn luyện Index. Bộ thứ nhất có tỷ lệ thành công hoàn thành nhiệm vụ tại 30 hộ gia đình xa lạ là 9%, trong khi bộ thứ hai đạt 56%.

Con số 56% này yêu cầu phải hoàn thành trọn vẹn nhiệm vụ, các trường hợp hoàn thành một phần sẽ không được tính điểm. Lấy ví dụ việc dọn dẹp phòng khách, tất cả đồ chơi phải được cho vào giỏ; nếu vì lý do an toàn mà cần sự can thiệp của con người, toàn bộ lượt thực thi đó sẽ bị tính là thất bại. Theo giao thức thí nghiệm mà Figure tiết lộ, sự khác biệt chính giữa hai nhóm mô hình là — liệu chúng có trải qua quá trình tiền huấn luyện Index hay không.

Nhóm thí nghiệm khác chuyển sang đánh giá ngoại tuyến (offline evaluation), tập trung khảo sát quy mô dữ liệu tiền huấn luyện.

Figure sử dụng bốn cấp độ tập con dữ liệu lồng nhau (nested data) của Index để huấn luyện mô hình, với tổng phạm vi dữ liệu tiền huấn luyện gấp 8 lần; kích thước mô hình không đổi và phương pháp huấn luyện hạ nguồn cũng được giữ nguyên. Mỗi mô hình sau đó được tinh chỉnh bằng cùng một dữ liệu nhiệm vụ để so sánh tổn thất (loss) dự đoán hành động của robot trên tập kiểm tra (test set) đã được tách riêng.

Khi quy mô dữ liệu Index tăng gấp đôi, tổn thất giảm theo quy luật. Figure còn sử dụng các thí nghiệm quy mô nhỏ hơn để khớp xu hướng, sau đó dự đoán kết quả kiểm tra của mô hình quy mô lớn nhất; phía công ty cho biết sai số dự đoán chỉ tương đương 0,54% sự thay đổi tổn thất trong toàn bộ phạm vi dữ liệu gấp 8 lần.

Kết quả của hai nhóm thí nghiệm này rất dễ bị hiểu nhầm là "Figure đã phát hiện ra Định luật quy mô (Scaling Law) cho robot", nhưng về bản chất, chúng là câu trả lời cho các vấn đề khác nhau.

Tỷ lệ từ 9% đến 56% trong nhóm thí nghiệm thứ nhất cho thấy, việc có hay không có tiền huấn luyện hành vi con người quy mô lớn sẽ ảnh hưởng đáng kể đến khả năng tổng quát hóa vòng lặp kín (closed-loop generalization) của robot trong môi trường xa lạ.

Đường cong tổn thất của bốn cấp độ dữ liệu trong nhóm thứ hai cho thấy, khi quy mô tiền huấn luyện dữ liệu con người tiếp tục mở rộng, lợi ích này thể hiện một đường cong có thể đo lường được theo quy mô trong việc dự đoán hành động của robot ở hạ nguồn.

Hiện tại, Figure chưa công bố tỷ lệ thành công tại các hộ gia đình thực tế tương ứng với mức tiền huấn luyện Index gấp 1, 2, 4 và 8 lần. Nói cách khác, đường cong về việc quy mô tiền huấn luyện tiếp tục mở rộng sẽ tạo ra sự thay đổi liên tục như thế nào đối với hiệu suất robot vòng lặp kín vẫn chưa được công khai.

Trên: Trong đánh giá vòng lặp kín của robot thực tế, Figure đã so sánh mô hình chưa qua tiền huấn luyện Index với mô hình đã qua tiền huấn luyện Index. Trong nhiều nhiệm vụ chưa từng thấy được công khai, tỷ lệ thành công của mô hình tiền huấn luyện Index đều cao hơn rõ rệt; Figure tóm tắt kết quả tổng thể trong văn bản chính là tỷ lệ thành công hoàn thành nhiệm vụ tăng từ 9% lên 56%. Nhóm thí nghiệm này trả lời cho câu hỏi: "Việc có tiền huấn luyện hành vi con người quy mô lớn hay không, có ảnh hưởng đến kết quả thực thi của robot thực tế không?". Dưới: Figure tiếp tục sử dụng 4 cấp độ dữ liệu Index lồng nhau nghiêm ngặt, mở rộng quy mô tiền huấn luyện từ 1 lần lên 8 lần, và quan sát thấy tổn thất xác thực dự đoán hành động của robot sau khi thích nghi tiếp tục giảm trong khi giữ nguyên quy mô mô hình, quy trình huấn luyện hạ nguồn và đánh giá. Nhóm thí nghiệm này trả lời cho câu hỏi: "Khi quy mô tiền huấn luyện dữ liệu con người tiếp tục mở rộng, các chỉ số chuyển đổi ngoại tuyến có thể hiện hiệu ứng quy mô có thể dự đoán được không?". Hai nhóm thí nghiệm này không phải là cùng một đường cong. Hiện tại Figure chưa công khai tỷ lệ thành công vòng lặp kín của robot thực tế tương ứng với quy mô tiền huấn luyện Index gấp 1, 2, 4, 8 lần, do đó không thể suy luận rằng "sau khi mở rộng quy mô tiền huấn luyện, tỷ lệ thành công của nhiệm vụ thực tế sẽ tăng liên tục theo cùng một quy luật".

Chính tại đây, vấn đề tiền huấn luyện robot năm 2026 đã xuất hiện một câu hỏi cụ thể hơn cả "Dữ liệu con người (Human Data) có hữu ích hay không":

Liệu kinh nghiệm con người có thể trở thành một nguồn dữ liệu có khả năng mở rộng liên tục và dự đoán được lợi ích hạ nguồn trong tiền huấn luyện robot, giống như văn bản đối với các mô hình lớn (Large Models) hay không?

Dyna: Hiệu ứng quy mô của dữ liệu con người đã đi vào vòng lặp kín của máy thực

Figure không phải là đội ngũ đầu tiên quan sát thấy "càng nhiều dữ liệu con người, robot càng được hưởng lợi".

Tháng 8, Dyna Robotics phát hành Dyna-2. Họ đã cấu trúc video con người ở góc nhìn thứ nhất thành bốn quy mô dữ liệu lồng nhau nghiêm ngặt: 1.000 giờ, 10.000 giờ, 100.000 giờ và 1 triệu giờ. Các tập dữ liệu lớn hơn chỉ đơn giản là tiếp tục thêm dữ liệu vào tập hợp nhỏ hơn, đồng thời tỷ lệ giữa các nguồn được giữ nguyên để cố gắng loại bỏ sự can thiệp của thay đổi phân phối dữ liệu vào kết quả.

Sau đó, Dyna sử dụng bốn cấp độ mô hình này để thích nghi với 14 nhiệm vụ robot thực tế bằng cùng một phương pháp hậu huấn luyện (post-training). Điểm chuẩn hóa trung bình của bốn cấp độ mô hình lần lượt đạt 20%, 28%, 45% và 53% giới hạn khả năng của nhiệm vụ. Nói cách khác, sự khác biệt về quy mô trong quá trình tiền huấn luyện video con người, sau khi trải qua cùng một quá trình hậu huấn luyện robot, cuối cùng đã kéo dài đến hiệu suất vòng lặp kín trên máy thực.

Lưu ý: Dyna sử dụng lần lượt 1.000 giờ, 10.000 giờ, 100.000 giờ và 1 triệu giờ video con người ở góc nhìn thứ nhất để tiền huấn luyện, sau đó sử dụng cùng một phương án hậu huấn luyện robot để thích nghi bốn cấp độ mô hình này với 14 nhiệm vụ robot thực tế. Khi quy mô tiền huấn luyện video con người mở rộng, hiệu suất chuẩn hóa trung bình của 14 nhiệm vụ lần lượt đạt 20%, 28%, 45% và 53% giới hạn khả năng của nhiệm vụ, cho thấy sự khác biệt về quy mô trong giai đoạn tiền huấn luyện vẫn kéo dài đến hiệu suất vòng lặp kín của robot thực tế sau khi đã qua cùng một quá trình hậu huấn luyện robot. Con số 20%—53% ở đây là hiệu suất chuẩn hóa trung bình do Dyna định nghĩa để tổng hợp các chỉ số gốc của các nhiệm vụ khác nhau, không phải là tỷ lệ thành công của nhiệm vụ và không thể so sánh trực tiếp với 56% tỷ lệ thành công hoàn thành nhiệm vụ mà Figure báo cáo tại 30 hộ gia đình xa lạ.

Do đó, dòng thời gian kỹ thuật chính xác hơn không phải là "Figure lần đầu tiên phát hiện ra định luật quy mô từ con người sang robot". Dyna trước đó đã đưa ra bằng chứng đầy đủ hơn về việc chuyển đổi từ quy mô tiền huấn luyện đến hiệu suất máy thực vòng lặp kín trên các thực thể khác nhau; trong khi Figure đã mở rộng hiệu ứng quy mô chuyển đổi có thể dự đoán được một cách rõ ràng sang hệ thống robot hình người toàn thân, và sử dụng 30 hộ gia đình xa lạ để làm cho giá trị thực tế của việc tiền huấn luyện con người trở nên trực quan hơn.

Ngoài 1 triệu giờ, Dyna còn đặt câu hỏi thông qua một nhóm thí nghiệm triệt tiêu (ablation study): Hiệu ứng quy mô này rốt cuộc đến từ đâu?

Khi dự đoán hành động một cách riêng lẻ, mô hình xuất hiện tình trạng quá khớp (overfitting) nghiêm trọng và không ổn định khi dữ liệu tăng lên. Sau khi thêm dự đoán video tương lai, hiệu suất chuyển đổi trên 39 nhiệm vụ robot đã cải thiện tổng thể; và khi các nhà nghiên cứu tăng thêm video con người không có nhãn hành động, chỉ dùng để dự đoán video, hiệu suất trên các thực thể mới cho thấy sự cải thiện đơn điệu ổn định theo quy mô dữ liệu.

Do đó, nếu chỉ nói "mở rộng quy mô dữ liệu con người sẽ liên tục nhận được lợi ích" thì vẫn chưa đủ chính xác.

Dữ liệu là gì và mô hình được yêu cầu học những gì từ đó, cùng nhau quyết định liệu hiệu ứng quy mô có xuất hiện hay không.

Một khi kinh nghiệm con người bắt đầu trở thành tài sản tiền huấn luyện cho robot, câu hỏi tự nhiên sẽ đổ dồn vào chính nguồn gốc dữ liệu: Những kinh nghiệm này nên đến từ đâu?

Figure: Thiết lập một chuỗi cung ứng dữ liệu con người có thể kiểm soát

Figure đã viết nhận định của mình rất thẳng thắn trong bản phát hành Index:

"Để huấn luyện robot thực sự đa năng ở quy mô lớn, dữ liệu cần thiết không tồn tại trong các video Internet với nguồn gốc rộng rãi."

Vì vậy, họ đã xây dựng chuỗi cung ứng Human Data của riêng mình.

Thông qua mạng lưới người sáng tạo Creator, Index cho phép mọi người ghi lại các nhiệm vụ trong gia đình và nơi làm việc thực tế. Đến cuối tháng 8, Figure cho biết nền tảng đã nhận được hơn 16 triệu video và đã trả tổng cộng 15 triệu USD cho những người sáng tạo; khi Helix 2.5 ra mắt, dữ liệu video con người mới đang được đưa vào Index với tốc độ khoảng 35 phút/giây. Dữ liệu sau đó còn phải trải qua quá trình lọc chất lượng, chống gian lận, khử trùng lặp, tái cân bằng và gắn nhãn văn bản.

RobotAIHọc máyComputer VisionCông nghệ mới

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Đột phá mới: Dạy robot làm việc qua video với 120 tỷ token hành động con người | AIHOT.vn