VnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
VnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam
VnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
  1. Trang chủ
  2. Blog
  3. WholeBodyVLA: video egocentric + RL loco-manipulation
researchmanipulationvlawhole-bodyloco-manipulationreinforcement-learningegocentric-videoagibot-x2unitree-g1humanoidresearch

WholeBodyVLA: video egocentric + RL loco-manipulation

WholeBodyVLA học từ video egocentric action-free và nối VLA cấp cao với RL controller cấp thấp cho whole-body loco-manipulation. Phân tích paper ICLR 2026, test trên AgiBot X2.

Nguyễn Anh Tuấn14 tháng 6, 20267 phút đọc
WholeBodyVLA: video egocentric + RL loco-manipulation

Ở bài 4, ta có perception toàn cảnh 3D cho humanoid. Nhưng perception mới là một nửa. Nửa còn lại — và là phần khó nhất của humanoid — là biến nhận thức thành hành động toàn thân: vừa giữ thăng bằng, vừa đi, vừa với tay thao tác, tất cả cùng lúc. Đó là whole-body loco-manipulation, và bài này phân tích một paper giải nó rất hay: WholeBodyVLA.

Paper: WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control — ICLR 2026. Test trên humanoid AgiBot X2.

WholeBodyVLA: unified latent VLA cho whole-body loco-manipulation — nguồn: arXiv 2512.11047
WholeBodyVLA: unified latent VLA cho whole-body loco-manipulation — nguồn: arXiv 2512.11047
Nguồn: WholeBodyVLA (arXiv 2512.11047) — từ video egocentric tới điều khiển loco-manipulation.

Bài toán: đi và thao tác không thể tách rời

Trong các series trước (GR00T N1 + Unitree G1), kiến trúc phổ biến là decoupled: một policy lo phần tay (manipulation), một controller lo phần chân (locomotion), chạy ở tần số khác nhau. Cách này hiệu quả khi hai việc độc lập — đứng yên gắp đồ, hoặc đi mà không cầm gì.

Nhưng whole-body loco-manipulation thật thì không tách rời được. Khi humanoid với tay lấy hộp nặng trên kệ cao:

  • Trọng tâm dịch chuyển → chân phải bù để khỏi ngã
  • Tay vươn xa → mô-men xoắn lên hông và thân
  • Cúi/nghiêng để tới gần → cả chuỗi động học từ chân đến tay phối hợp

Tay và chân phải "đàm phán" với nhau theo thời gian thực. WholeBodyVLA giải bằng cách thống nhất chúng trong một framework, nhưng vẫn tôn trọng việc tay và chân chạy ở tần số khác nhau.

Ba ý tưởng cốt lõi của WholeBodyVLA

1. Unified latent VLA

Thay vì hai policy rời rạc, WholeBodyVLA dùng một VLA sinh ra latent action thống nhất — một biểu diễn trung gian mã hóa "ý định toàn thân" (đi đâu, với tay gì, tư thế ra sao). Latent này không phải lệnh khớp trực tiếp, mà là mục tiêu cấp cao để tầng dưới thực thi.

Lợi ích: VLA reasoning một lần về cả thân, tránh tình huống tay và chân "đánh nhau" vì hai policy ra quyết định mâu thuẫn.

2. Học từ video egocentric action-free

Đây là điểm đột phá về data. Thu data robot thật (teleop) rất đắt và chậm — chủ đề ta sẽ mổ xẻ kỹ ở bài 6. WholeBodyVLA tận dụng video egocentric action-free: video quay từ góc nhìn thứ nhất (người đeo camera đầu làm việc nhà, thao tác đồ vật) — không có nhãn action (không biết khớp nào quay bao nhiêu), chỉ có hình ảnh.

Vì sao video action-free rẻ hơn nhiều:

Nguồn data Cần robot? Cần nhãn action? Chi phí Quy mô
Teleop robot Có Có (chính xác) Rất cao Nhỏ
Video egocentric action-free Không Không Rất thấp Khổng lồ (YouTube, Ego4D)

WholeBodyVLA học biểu diễn và ý định từ biển video action-free đó, rồi mới dùng một lượng nhỏ data robot để "neo" latent vào hành động thật.

3. Nối VLA cấp cao với RL controller cấp thấp

Đây là kiến trúc decoupled high/low frequency mà ta đã gặp ở các series humanoid trước, nhưng làm sạch sẽ:

Quan sát (egocentric + state)
        ↓
VLA cấp cao (chậm, ~vài Hz)
   → latent action toàn thân (ý định)
        ↓
RL loco-manipulation controller (nhanh, ~hàng trăm Hz)
   → torque/joint command giữ thăng bằng + thực thi ý định
        ↓
Robot (AgiBot X2 / Unitree G1)
  • VLA cấp cao chạy chậm, lo "làm gì" — đọc cảnh, hiểu instruction, ra latent.
  • RL controller cấp thấp chạy nhanh, lo "làm sao" — biến latent thành chuyển động giữ được thăng bằng. Phần này huấn luyện bằng RL trong simulation (Isaac Lab / MuJoCo), nơi robot ngã hàng triệu lần để học đứng vững.

Sự phân tách tần số này không phải tùy tiện: reasoning thị giác-ngôn ngữ vốn chậm, còn giữ thăng bằng cần vòng điều khiển tần số cao. Ép cả hai vào một tần số là sai lầm kinh điển.

Liên hệ với phần còn lại của series

WholeBodyVLA không thay thế những gì ta đã học — nó ngồi trên đỉnh:

  • 3D pretraining (SPEAR-1, bài 1). Backbone hiểu hình học 3D càng tốt thì latent VLA càng chính xác về không gian. 3D-aware là nền cho VLA tốt.
  • Robo3R (bài 2). Cung cấp scene 3D metric trong robot frame để VLA reasoning về va chạm và khoảng cách thật khi với tay.
  • DP3 (bài 3). Là lựa chọn policy cho phần manipulation tinh xảo của tay, trong khi WholeBodyVLA lo điều phối toàn thân.
  • Perception toàn cảnh (bài 4). Cho VLA "thấy" vùng ngoài FOV để lập kế hoạch đi tới và với tay.

Nói cách khác: bài 1–4 xây perception và policy cho từng mảnh; WholeBodyVLA là bộ điều phối toàn thân ghép chúng lại thành một con humanoid biết vừa đi vừa làm.

So sánh: decoupled cũ vs unified latent VLA

Tiêu chí Decoupled (2 policy rời) WholeBodyVLA (unified latent)
Phối hợp tay-chân Yếu (hai policy độc lập) Mạnh (latent thống nhất)
Nguồn data chính Teleop robot (đắt) Video action-free (rẻ) + ít teleop
Giữ thăng bằng Controller riêng RL controller cấp thấp
Reasoning cấp cao Hạn chế VLA đầy đủ vision-language
Phù hợp Task đơn giản, tách bạch Loco-manipulation thật, phức tạp

Lưu ý khi áp dụng cho Unitree G1

Paper test trên AgiBot X2, nhưng kiến trúc tổng quát cho mọi humanoid có RL loco controller. Với Unitree G1:

  • Cần một RL loco-manipulation controller tốt trước. Latent VLA chỉ ra ý định; nếu controller cấp thấp không giữ nổi thăng bằng khi với tay xa, cả hệ sụp. Đầu tư vào RL controller trong sim (Isaac Lab) là bắt buộc — xem bài 7.
  • Domain gap của video. Video egocentric của người khác hình thái với robot (tỉ lệ tay, số ngón, tầm với). Cần retargeting/alignment để latent học từ người chuyển được sang G1.
  • Sim2real cho phần loco. RL controller huấn luyện trong sim cần domain randomization + mô hình trễ actuator để không "vỡ" khi lên robot thật (kỹ thuật đã bàn ở ASAP/Unitree G1).

Kết: VLA toàn thân là đích đến, data là nút thắt

WholeBodyVLA cho thấy hướng đi của humanoid 2026: một VLA thống nhất điều phối toàn thân, học phần lớn từ video rẻ tiền, thực thi qua RL controller giữ thăng bằng. Đây là nơi tất cả các mảnh của series hội tụ — 3D perception, point-cloud policy, perception toàn cảnh — vào một hệ biết vừa đi vừa thao tác.

Nhưng paper này phơi bày một sự thật: data là nút thắt. Video action-free rẻ nhưng thiếu nhãn action; teleop chính xác nhưng đắt. Làm sao chọn đúng chiến lược thu data cho ngân sách của bạn? Đó là toàn bộ nội dung bài 6.


Bài viết liên quan

  • Bài 4: Omni-Manip & spatial reasoning cho humanoid — Perception toàn cảnh nuôi VLA toàn thân
  • Bài 6: Thu data — teleop vs robot-free vs video — Giải nút thắt data của VLA
  • GR00T N1 + Unitree G1: kiến trúc whole-body VLA — So sánh kiến trúc decoupled tay/chân
NT

Nguyễn Anh Tuấn

Robotics & AI Engineer. Building VnRobo — sharing knowledge about robot learning, VLA models, and automation.

Khám phá VnRobo

Fleet MonitoringROS 2 IntegrationAMR Solutions
robot-3d-manipulation-vla — Phần 5/7
← Perception 3D cho humanoid: Omni-Manip & spatial reasoningThu data manipulation: teleop vs robot-free vs video →

Bài viết liên quan

Nghiên cứu
Perception 3D cho humanoid: Omni-Manip & spatial reasoning
manipulationhumanoid3d-perceptionPhần 4
research

Perception 3D cho humanoid: Omni-Manip & spatial reasoning

Humanoid vừa đi vừa với tay ra xa cần perception ngoài FOV camera và active spatial reasoning. Phân tích Omni-Manip và Active Spatial Reasoning — 2 paper humanoid 2026.

14/6/20268 phút đọc
NT
Nghiên cứu
Thu data manipulation: teleop vs robot-free vs video
manipulationdata-collectionteleoperationPhần 6
research

Thu data manipulation: teleop vs robot-free vs video

Ba chiến lược thu dữ liệu whole-body manipulation — teleop, robot-free demo (HuMI), và video egocentric action-free. Bảng so sánh cost/quality/throughput và cách chọn theo ngân sách.

14/6/20267 phút đọc
NT
Nghiên cứu
Vì sao VLA 2D chưa đủ cho manipulation
manipulationvla3d-reconstructionPhần 1
research

Vì sao VLA 2D chưa đủ cho manipulation

Policy và VLA chỉ dùng ảnh RGB 2D đang chạm trần: depth ambiguity, occlusion, thiếu metric scale. Bài mở đầu series giải thích vì sao 3D là hướng đi tất yếu và bức tranh toàn cảnh từ DP3 đến WholeBodyVLA.

13/6/202614 phút đọc
NT
VnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam