# Stardust Intelligence ra mắt SmoothRL: Tối ưu hóa học tăng cường trực tuyến cho suy luận bất đồng bộ

- Nguồn: elsewhere: Bài viết
- Thời gian phát hành: 2026-09-04 10:05 (giờ Việt Nam)
- Điểm AI: 22/100
- Link AIHOT.vn: https://aihot.vn/items/524e0da4b40783ce
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtmgjoiu01c8rolu3j2l3gno
- Link gốc: https://elsewhere.news/zh/yunqipartners/smoothrl

## Tóm tắt AI

Stardust Intelligence giới thiệu SmoothRL, giải pháp giúp robot duy trì hoạt động liên tục mà không cần chờ đợi phản hồi từ các mô hình ngôn ngữ lớn, giải quyết bài toán độ trễ trong suy luận bất đồng bộ.

## Thân bài

![Astribot Releases SmoothRL, Enabling Online Reinforcement Learning to Keep Pace with LLMs' Asynchronous Inference | Yunqi Partners](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/25fb58b0-2a9e-4cb9-8d0e-c612f7e8620a/1406ce852d4c.jpg)

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/25fb58b0-2a9e-4cb9-8d0e-c612f7e8620a/7fb93e98fe92.png)

Khi các VLA và World-Action Model ngày càng lớn hơn và thời gian suy luận kéo dài, các robot trong môi trường triển khai thực tế từ lâu đã chuyển sang suy luận bất đồng bộ (asynchronous inference) — thực hiện tác vụ A trong khi mô hình tính toán tác vụ B ở chế độ nền. Tuy nhiên, "thực tế triển khai" này đặt ra một thách thức mới cho học tăng cường trực tuyến (online reinforcement learning): các hành động mà mô hình "lên kế hoạch" và các hành động mà robot "thực sự thực hiện" không còn khớp nhau nữa. Ai sẽ được ghi nhận cho thành công, và ai sẽ chịu trách nhiệm cho thất bại?

Gần đây, đội ngũ mô hình nền tảng tại Astribot, một công ty về trí tuệ hiện thân (embodied intelligence) được dẫn dắt bởi Yunqi Capital, đã đưa ra câu trả lời: ra mắt SmoothRL, một khung học tăng cường trực tuyến có khả năng thực thi bất đồng bộ. Khung này đã được xác thực lần đầu tiên trên các tác vụ ném động lực cao trong thế giới thực: tỷ lệ thành công khi ném động lực tăng từ 39% lên 94%, đóng nắp bút từ 8% lên 83% và mở gói hàng từ 30% lên 90%.

Từ "liệu nó có làm được không" đến "chính xác hơn, ổn định hơn, đáng tin cậy hơn" — tiền huấn luyện dạy robot cách hành động, và hậu huấn luyện trong thế giới thực giúp mài giũa các khả năng đó đạt đến độ chính xác sẵn sàng cho triển khai. Chúng tôi tiếp tục theo dõi Astribot thúc đẩy phương pháp tiếp cận toàn diện "Mô hình AI — Hệ điều hành hiện thân — Phần cứng dẫn động bằng cáp" hướng tới việc triển khai quy mô lớn Physical AI.

Robot thực tế không có "nút tạm dừng".

Các VLA và World-Action Model ngày nay thường tạo ra các chuỗi hành động — các đoạn hành động (action chunks) — trải dài trong các khung thời gian tương lai. Khi các mô hình mở rộng quy mô, thời gian suy luận cũng tăng theo. Nhưng robot không thể chỉ đơn giản dừng lại sau mỗi vài trăm mili giây để chờ đợi đoạn hành động tiếp theo. Trong các tác vụ động lực cao như ném, một lần tạm dừng duy nhất có thể làm tiêu tan vận tốc tích lũy và phá hỏng toàn bộ nỗ lực.

Vì vậy, các triển khai thực tế thường dựa vào suy luận bất đồng bộ: robot tiếp tục thực hiện các hành động hiện tại trong khi mô hình tính toán phân đoạn tiếp theo ở chế độ nền. Tóm lại, tay đang làm A, mô hình đã tính toán xong B.

Nhưng điều này tạo ra một vấn đề mới cho học tăng cường trực tuyến. Mô hình tạo ra một đoạn hành động, nhưng chỉ một phần trong đó thực sự đi vào thế giới vật lý. Các hành động mà mô hình "lên kế hoạch" và các hành động mà robot "thực sự thực hiện" không còn đồng nhất.

Gần đây, đội ngũ mô hình nền tảng của Astribot đã phát hành SmoothRL (Học tăng cường trực tuyến trong quá trình thực thi bất đồng bộ), một khung RL trực tuyến được thiết kế cho thực thi bất đồng bộ. Nó giải quyết một câu hỏi quan trọng: khi suy luận bất đồng bộ của mô hình lớn trở thành tiêu chuẩn triển khai, thì RL trực tuyến nên học từ những hành động nào?

Báo cáo kỹ thuật + video chưa chỉnh sửa:

www.astribot.com/en/research/SmoothRL

SmoothRL đánh dấu lần đầu tiên RL trực tuyến bất đồng bộ như vậy được xác thực trên các tác vụ ném động lực cao trong thế giới thực, chứng minh thêm rằng học trực tuyến không chỉ phục vụ việc hiệu chỉnh độ chính xác cao mà còn cho các hoạt động động lực liên quan đến gia tốc liên tục, giải phóng chính xác và không chấp nhận việc tạm dừng.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/25fb58b0-2a9e-4cb9-8d0e-c612f7e8620a/f53eaaad6866.png)

Khung tổng thể của SmoothRL: robot liên tục tạo ra dữ liệu thế giới thực trong quá trình thực thi bất đồng bộ; chính sách cơ sở cung cấp các khả năng tổng quát, và RL trực tuyến cập nhật chính sách hành động dựa trên kết quả thực thi thực tế.

### Tại sao RL lại "ghi nhận sai" công và tội?

RL trực tuyến truyền thống thường giả định một nhịp điệu gọn gàng hơn: mô hình tính toán hành động, robot thực hiện chúng, và chính sách cập nhật dựa trên kết quả. Những gì mô hình tạo ra, robot thực hiện.

Thực thi bất đồng bộ phá vỡ sự tương ứng này. Khi một đoạn hành động mới sẵn sàng, robot đã thực hiện được một phần của chỉ dẫn trước đó; và trước khi đoạn mới này thực thi hoàn toàn, kết quả suy luận tiếp theo có thể đến và thay thế nửa sau của nó. Vì vậy, trong một đoạn hành động duy nhất, một số hành động đã quá muộn để thay đổi, một số thực sự được thực hiện, và một số không bao giờ xảy ra.

Nếu học tăng cường vẫn tối ưu hóa toàn bộ đoạn hành động một cách đồng nhất, một vấn đề trực tiếp sẽ nảy sinh: các hành động mà robot không thể thay đổi hoặc chưa bao giờ thực hiện vẫn có thể được "ghi công" cho thành công hoặc "đổ lỗi" cho thất bại.

SmoothRL giải quyết vấn đề hạch toán này trước tiên. Nó chia đoạn hành động thành ba vùng dựa trên trạng thái thực thi:

Vùng cam kết (Committed region): Các hành động đã được "cam kết" bởi vòng suy luận trước đó, không thể thay đổi và chắc chắn sẽ thực thi.

Vùng thực thi (Execution region): Các hành động từ đoạn mới tạo ra mà robot sẽ thực sự thực hiện.

Vùng loại bỏ (Discarded region): Các hành động mà mô hình đã tạo ra nhưng robot sẽ không bao giờ thực hiện, vì vòng suy luận tiếp theo sẽ ghi đè lên chúng.

Ba vùng này không thể được đối xử bình đẳng trong quá trình huấn luyện. Điểm cốt lõi của SmoothRL: chỉ củng cố những gì robot thực sự thực hiện — nghĩa là, chỉ để gradient đi qua vùng thực thi.

Điều này đảm bảo mục tiêu tối ưu hóa phù hợp với quá trình mà robot thực sự trải nghiệm khi vận hành. Bước thứ hai: làm cho việc huấn luyện và triển khai tuân theo cùng một nhịp điệu thời gian. SmoothRL chạy suy luận bất đồng bộ trực tiếp trong quá trình triển khai huấn luyện: tính toán của mô hình và thực thi của robot diễn ra song song, và bộ đệm phát lại (replay buffer) ghi lại các quỹ đạo được tạo ra dưới mối quan hệ thời gian thực này. Đội ngũ đúc kết nguyên tắc này là Reinforce in Deployment — không phải huấn luyện trong một thế giới đồng bộ lý tưởng rồi chuyển sang triển khai bất đồng bộ, mà là đối mặt với động lực thực thi mà robot sẽ thực sự gặp phải ngay từ khi bắt đầu huấn luyện.

Trong phần triển khai cụ thể của bài báo, nhóm sử dụng π0.5 đã tinh chỉnh làm chính sách cơ sở cho mỗi tác vụ, xây dựng trên khung RLT, và sử dụng actor-critic kiểu TD3 nhẹ để dự đoán các hiệu chỉnh dư trong không gian hành động gốc. Robot S1 thực thi các hành động ở tần số 30 Hz với các yêu cầu suy luận ở 5 Hz — một đoạn hành động mới sau mỗi 200 ms. Chính sách cơ sở dự đoán các đoạn hành động 32 khung hình; dưới ngân sách độ trễ cố định, vùng Cam kết và Thực thi cùng chiếm 12 khung hình, với 6 khung hình thuộc về Vùng thực thi thực tế của vòng hiện tại, trong khi 20 khung hình còn lại bị ghi đè bởi các đoạn tiếp theo trước khi thực thi.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/25fb58b0-2a9e-4cb9-8d0e-c612f7e8620a/cf7bee27db49.png)

SmoothRL chia các đoạn hành động bất đồng bộ thành các vùng Cam kết / Thực thi / Loại bỏ, cho phép gradient giá trị chỉ đi qua Vùng thực thi thực sự được thực hiện.

### Kiểm tra hai loại thách thức triển khai thực tế

Nhóm đã thử nghiệm ba tác vụ phần cứng thực tế trên nền tảng S1 dẫn động bằng cáp của Astribot, bao gồm hai kịch bản phổ biến và bổ sung cho nhau: thao tác động lực tốc độ cao và thao tác hai tay độ chính xác cao.

Đặc biệt đối với các tác vụ động lực cao: chuyển động của robot thay đổi nhanh chóng, và việc chờ đợi tính toán của mô hình ở mỗi bước sẽ gây ra hiện tượng giật lag, khiến suy luận bất đồng bộ trở nên thiết yếu.

Ném động lực: 39% → 94%. Robot phải nắm bắt các vật thể từ các vị trí ngẫu nhiên và ném chúng vào các thùng mục tiêu ở các vị trí khác nhau. Tác vụ này không kết thúc ở việc đạt được tư thế mục tiêu; nó đòi hỏi cánh tay phải liên tục tạo vận tốc trong khi vung và giải phóng tại thời điểm chính xác. Bài báo đặc biệt lưu ý rằng một lần tạm dừng tại ranh giới đoạn hành động có thể gần như làm cánh tay dừng lại, khiến việc khôi phục vận tốc giải phóng trong phần vung còn lại trở nên khó khăn. Do đó, nó đặc biệt nhạy cảm với thực thi bất đồng bộ. Tại điểm kiểm tra đánh giá sau 250 tập triển khai tích lũy, tỷ lệ thành công đã cải thiện từ 39% với chính sách cơ sở lên 94%.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/25fb58b0-2a9e-4cb9-8d0e-c612f7e8620a/2a17b78073f7.png)

Đóng nắp bút: 8% → 83%. Cả hai tay phải căn chỉnh chính xác bút và nắp, với sai số tư thế tương đối cho phép khoảng 5 mm. Chính sách cơ sở thường đạt đến vùng lân cận chung nhưng thích ứng kém với các biến thể nhỏ ở vị trí nắp. Tỷ lệ thành công cuối cùng đã cải thiện từ 8% lên 83%.

![](https://kkcktdhgzddmdjdjoenc.supabase.co/storage/v1/object/public/media/images/25fb58b0-2a9e-4cb9-8d0e-c612f7e8620a/e75ab520dee5.png)

Mở gói hàng: 30% → 90%. Robot phải chèn một lưỡi dao rộng khoảng 1 mm vào khe nắp hộp rộng chỉ 2–3 mm, sau đó cắt băng dính dọc theo đường nối. Chính sách cơ sở cho thấy xu hướng lệch trái nhất quán. Đáng chú ý, đường cong học tập của nó không cải thiện đơn điệu: ở 150 tập triển khai, thành công tạm thời giảm từ 30% xuống 20%, sau đó phục hồi lên 40%, cuối cùng đạt 90%. Khám phá trực tuyến thực tế không nhất thiết phải cải thiện đều đặn.

Thay đổi tỷ lệ thành công qua ba tác vụ phần cứng thực tế khi số tập triển khai tích lũy tăng lên.

Điều đáng chú ý hơn cả tỷ lệ thành công là cách các thất bại của robot đã thay đổi.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://elsewhere.news/zh/yunqipartners/smoothrl>
