Show-Harness giới thiệu một bộ giao diện chuẩn hóa, cho phép các mô hình ngôn ngữ thị giác (VLM) điều khiển robot trong thế giới thực mà không cần tinh chỉnh phức tạp, thu hẹp khoảng cách giữa trí tuệ số và hành động vật lý.
Vì sao đáng đọc: Đề tài (Embodied AI) đang là xu hướng nóng. Bài báo cung cấp giải pháp thực tiễn, mã nguồn mở và dữ liệu đầy đủ, có giá trị cao cho cộng đồng nghiên cứu robot.
AdaRoboVLG giải quyết thách thức gắp vật thể phức tạp bằng cách tách biệt hiểu biết nhiệm vụ và kỹ thuật gắp, cho phép robot thích ứng linh hoạt với nhiều loại tay máy và tình huống khác nhau mà không cần huấn luyện lại.
ULTRA là khung điều khiển đa phương thức thống nhất cho phép robot hình người như Unitree G1 thực hiện các thao tác phức tạp chỉ với mục tiêu đích, thay vì cần hướng dẫn chi tiết từng khung hình, giúp tối ưu hóa khả năng phối hợp toàn thân.
Vì sao đáng đọc: Nghiên cứu đột phá về điều khiển robot hình người, được đề cử giải thưởng tại hội nghị uy tín IROS 2026, có tính ứng dụng cao trong thực tế.
Black Forest Labs vừa trình làng FLUX 3 Action, mô hình điều khiển robot mã nguồn mở với 7 tỷ tham số. FLUX 3 Action đã xuất sắc chiếm lĩnh vị trí số 1 trên RoboLab-120 với tỷ lệ thành công 42,92%, vượt xa Cosmos 3 Nano về hiệu suất dù sở hữu kích thước nhỏ gọn hơn đáng kể.
MemBodied là cơ chế bộ nhớ tình huống cố định giúp các mô hình VLA duy trì trạng thái liên kết và các điểm neo bối cảnh, thay thế việc chồng chéo dữ liệu quan sát lịch sử thô.
Phòng thí nghiệm AI Thượng Hải ra mắt InternW0, mô hình thế giới vật lý sử dụng kiến trúc video-hành động bất đối xứng để tối ưu hóa dự đoán hình ảnh dài hạn và điều khiển robot liên tục với hiệu suất cao.
AgiBot vừa giới thiệu AGILE 2.0, mô hình điều khiển đầu-cuối tích hợp thị giác, phân tích địa hình và khả năng vận động toàn thân, giúp robot thích nghi linh hoạt với môi trường thực tế.
Nghiên cứu giới thiệu phương pháp Movement Trend Guidance giúp mô hình AI dự đoán xu hướng tương tác trong tương lai mà không cần lập kế hoạch chi tiết, giúp robot thao tác chính xác hơn dựa trên lịch sử quan sát.
Được vinh danh tại CoRL 2026, mô hình World Synesthesia (WSM) tích hợp thị giác, xúc giác và cảm giác bản thể để giúp bàn tay robot 22 bậc tự do xử lý nhiễu cảm biến và ngoại lực, cho phép thao tác vật thể ổn định ngay cả với các vật thể chưa từng gặp.
Vì sao đáng đọc: Nghiên cứu giải quyết bài toán hóc búa về tính ổn định của robot linh hoạt trong môi trường thực tế, có mã nguồn mở và được công nhận tại hội nghị hàng đầu CoRL.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứu giới thiệu chỉ số PRC nhằm đảm bảo tính nhất quán về khoảng cách vật lý trong quá trình mã hóa hành động, giúp cải thiện độ chính xác cho các mô hình VLA điều khiển robot.
Dynin-Robotics sử dụng mô hình khuếch tán đa phương thức để dự đoán mục tiêu và động lực học, giúp robot thực hiện hành động chính xác hơn thông qua việc hiểu ngôn ngữ và quan sát hình ảnh.
Show-Harness cung cấp giao diện hành động ngữ nghĩa rời rạc, giúp các mô hình ngôn ngữ thị giác (VLM) điều khiển robot trực tiếp mà không cần huấn luyện chuyên sâu hay bổ sung mô hình phức tạp.
Nghiên cứu đề xuất phương pháp Action Map Policy, áp dụng cơ chế Cross-Entropy từ mô hình ngôn ngữ lớn vào điều khiển robot, giúp giải quyết bài toán không gian hành động đa chiều phức tạp thông qua phân loại thay vì hồi quy truyền thống.
Vì sao đáng đọc: Chủ đề mang tính đột phá, kết nối thành công Scaling Law của LLM vào lĩnh vực robot học, có tiềm năng thay đổi cách huấn luyện tác nhân vật lý hiện nay.
EmbodiedSkills là khung làm việc mới giúp các tác nhân VLA thực hiện nhiệm vụ phức tạp bằng cách kết hợp kiểm tra điều kiện tiên quyết và xác thực kết quả sau hành động, đảm bảo tính chính xác trong môi trường thực tế.
RoboTok là hệ thống đột phá giúp trích xuất các video thao tác của con người từ Internet để huấn luyện robot, giải quyết bài toán thiếu hụt dữ liệu thực tế thông qua không gian chuyển động 3D linh hoạt.
Vì sao đáng đọc: Giải quyết trực tiếp nút thắt lớn nhất trong robot học là dữ liệu. Phương pháp tìm kiếm dựa trên chuyển động 3D rất sáng tạo và có tính ứng dụng thực tiễn cao.
Bài tổng quan trên T-RO thiết lập khung phân tích mới cho robot thao tác, phân tách rõ ràng giữa lập kế hoạch cấp cao và mô hình hóa hành động cấp thấp trong kỷ nguyên mô hình nền tảng.
Vì sao đáng đọc: Đây là bài tổng quan chất lượng cao từ các đại học hàng đầu, giúp định hình lại tư duy nghiên cứu robot vốn đang bị nhiễu loạn bởi quá nhiều thuật ngữ mới.
PonderPounce kết hợp mô hình MLLM 'Ponder' để suy luận ngữ cảnh và VLA 'Pounce' để thực thi hành động, giúp robot ghi nhớ lịch sử và đưa ra quyết định thông minh hơn mà không cần cơ chế bộ nhớ riêng biệt.
MA-VLA là khung làm việc mới giúp điều phối nhiều cánh tay robot thông qua việc phân tách nhiệm vụ thành các hành động nguyên tử, cho phép robot thực hiện các tác vụ phối hợp phức tạp ngay cả với những kịch bản chưa từng gặp.
pure willpower on metal legs force sensing in the wrists has to be feeding straight into the balanc…
DịchKhám phá cách robot hình người xử lý phản hồi lực từ cổ tay trực tiếp vào bộ điều khiển cân bằng, cho phép điều chỉnh trọng tâm hông cực nhanh khi dây cáp thay đổi góc độ.
Nhóm nghiên cứu đề xuất BCP, cho phép mô hình VLA tự quyết định việc tiếp tục thực hiện hay tái lập kế hoạch thay vì dùng tham số cố định, giúp tăng đáng kể độ chính xác cho các tác vụ robot phức tạp.
Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề cốt lõi trong điều khiển robot (VLA), cải thiện hiệu suất thực tế đáng kể bằng phương pháp sáng tạo, có tính ứng dụng cao trong lĩnh vực robotics.
Zetta là khung làm việc đột phá cho phép robot tự cập nhật kỹ năng và đánh giá hành vi theo thời gian thực mà không cần thay đổi mô hình gốc, giúp giải quyết hạn chế của các hệ thống điều khiển vòng lặp hở hiện nay.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực robot học (embodied AI), giải quyết bài toán khó về khả năng phản ứng tức thời và tự học của robot trong môi trường thực tế.
Symbiosis Robotics giới thiệu hệ thống DPC cho phép robot tự lái xe Go-kart, xử lý mượt mà từ việc vào xe đến kỹ thuật drift nhờ khả năng kết hợp trực tiếp dữ liệu hình ảnh và phản hồi cơ thể mà không cần qua lớp trung gian.
Vì sao đáng đọc: Tin tức thú vị về robot hình người với ứng dụng thực tế trực quan, giải quyết bài toán khó trong điều khiển toàn thân (whole-body control) bằng công nghệ DPC mới.
14/08
Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
DreamX-Phi 1.0 là mô hình thế giới video dự đoán trạng thái tương lai dựa trên hình ảnh, lệnh ngôn ngữ và chuỗi hành động. Mô hình tối ưu hóa khả năng điều khiển robot thông qua mã hóa hình học PRoPE và kỹ thuật duy trì tính nhất quán của vật thể.