Ở bài 4, ta có perception toàn cảnh 3D cho humanoid. Nhưng perception mới là một nửa. Nửa còn lại — và là phần khó nhất của humanoid — là biến nhận thức thành hành động toàn thân: vừa giữ thăng bằng, vừa đi, vừa với tay thao tác, tất cả cùng lúc. Đó là whole-body loco-manipulation, và bài này phân tích một paper giải nó rất hay: WholeBodyVLA.
Paper: WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control — ICLR 2026. Test trên humanoid AgiBot X2.

Bài toán: đi và thao tác không thể tách rời
Trong các series trước (GR00T N1 + Unitree G1), kiến trúc phổ biến là decoupled: một policy lo phần tay (manipulation), một controller lo phần chân (locomotion), chạy ở tần số khác nhau. Cách này hiệu quả khi hai việc độc lập — đứng yên gắp đồ, hoặc đi mà không cầm gì.
Nhưng whole-body loco-manipulation thật thì không tách rời được. Khi humanoid với tay lấy hộp nặng trên kệ cao:
- Trọng tâm dịch chuyển → chân phải bù để khỏi ngã
- Tay vươn xa → mô-men xoắn lên hông và thân
- Cúi/nghiêng để tới gần → cả chuỗi động học từ chân đến tay phối hợp
Tay và chân phải "đàm phán" với nhau theo thời gian thực. WholeBodyVLA giải bằng cách thống nhất chúng trong một framework, nhưng vẫn tôn trọng việc tay và chân chạy ở tần số khác nhau.
Ba ý tưởng cốt lõi của WholeBodyVLA
1. Unified latent VLA
Thay vì hai policy rời rạc, WholeBodyVLA dùng một VLA sinh ra latent action thống nhất — một biểu diễn trung gian mã hóa "ý định toàn thân" (đi đâu, với tay gì, tư thế ra sao). Latent này không phải lệnh khớp trực tiếp, mà là mục tiêu cấp cao để tầng dưới thực thi.
Lợi ích: VLA reasoning một lần về cả thân, tránh tình huống tay và chân "đánh nhau" vì hai policy ra quyết định mâu thuẫn.
2. Học từ video egocentric action-free
Đây là điểm đột phá về data. Thu data robot thật (teleop) rất đắt và chậm — chủ đề ta sẽ mổ xẻ kỹ ở bài 6. WholeBodyVLA tận dụng video egocentric action-free: video quay từ góc nhìn thứ nhất (người đeo camera đầu làm việc nhà, thao tác đồ vật) — không có nhãn action (không biết khớp nào quay bao nhiêu), chỉ có hình ảnh.
Vì sao video action-free rẻ hơn nhiều:
| Nguồn data | Cần robot? | Cần nhãn action? | Chi phí | Quy mô |
|---|---|---|---|---|
| Teleop robot | Có | Có (chính xác) | Rất cao | Nhỏ |
| Video egocentric action-free | Không | Không | Rất thấp | Khổng lồ (YouTube, Ego4D) |
WholeBodyVLA học biểu diễn và ý định từ biển video action-free đó, rồi mới dùng một lượng nhỏ data robot để "neo" latent vào hành động thật.
3. Nối VLA cấp cao với RL controller cấp thấp
Đây là kiến trúc decoupled high/low frequency mà ta đã gặp ở các series humanoid trước, nhưng làm sạch sẽ:
Quan sát (egocentric + state)
↓
VLA cấp cao (chậm, ~vài Hz)
→ latent action toàn thân (ý định)
↓
RL loco-manipulation controller (nhanh, ~hàng trăm Hz)
→ torque/joint command giữ thăng bằng + thực thi ý định
↓
Robot (AgiBot X2 / Unitree G1)
- VLA cấp cao chạy chậm, lo "làm gì" — đọc cảnh, hiểu instruction, ra latent.
- RL controller cấp thấp chạy nhanh, lo "làm sao" — biến latent thành chuyển động giữ được thăng bằng. Phần này huấn luyện bằng RL trong simulation (Isaac Lab / MuJoCo), nơi robot ngã hàng triệu lần để học đứng vững.
Sự phân tách tần số này không phải tùy tiện: reasoning thị giác-ngôn ngữ vốn chậm, còn giữ thăng bằng cần vòng điều khiển tần số cao. Ép cả hai vào một tần số là sai lầm kinh điển.
Liên hệ với phần còn lại của series
WholeBodyVLA không thay thế những gì ta đã học — nó ngồi trên đỉnh:
- 3D pretraining (SPEAR-1, bài 1). Backbone hiểu hình học 3D càng tốt thì latent VLA càng chính xác về không gian. 3D-aware là nền cho VLA tốt.
- Robo3R (bài 2). Cung cấp scene 3D metric trong robot frame để VLA reasoning về va chạm và khoảng cách thật khi với tay.
- DP3 (bài 3). Là lựa chọn policy cho phần manipulation tinh xảo của tay, trong khi WholeBodyVLA lo điều phối toàn thân.
- Perception toàn cảnh (bài 4). Cho VLA "thấy" vùng ngoài FOV để lập kế hoạch đi tới và với tay.
Nói cách khác: bài 1–4 xây perception và policy cho từng mảnh; WholeBodyVLA là bộ điều phối toàn thân ghép chúng lại thành một con humanoid biết vừa đi vừa làm.
So sánh: decoupled cũ vs unified latent VLA
| Tiêu chí | Decoupled (2 policy rời) | WholeBodyVLA (unified latent) |
|---|---|---|
| Phối hợp tay-chân | Yếu (hai policy độc lập) | Mạnh (latent thống nhất) |
| Nguồn data chính | Teleop robot (đắt) | Video action-free (rẻ) + ít teleop |
| Giữ thăng bằng | Controller riêng | RL controller cấp thấp |
| Reasoning cấp cao | Hạn chế | VLA đầy đủ vision-language |
| Phù hợp | Task đơn giản, tách bạch | Loco-manipulation thật, phức tạp |
Lưu ý khi áp dụng cho Unitree G1
Paper test trên AgiBot X2, nhưng kiến trúc tổng quát cho mọi humanoid có RL loco controller. Với Unitree G1:
- Cần một RL loco-manipulation controller tốt trước. Latent VLA chỉ ra ý định; nếu controller cấp thấp không giữ nổi thăng bằng khi với tay xa, cả hệ sụp. Đầu tư vào RL controller trong sim (Isaac Lab) là bắt buộc — xem bài 7.
- Domain gap của video. Video egocentric của người khác hình thái với robot (tỉ lệ tay, số ngón, tầm với). Cần retargeting/alignment để latent học từ người chuyển được sang G1.
- Sim2real cho phần loco. RL controller huấn luyện trong sim cần domain randomization + mô hình trễ actuator để không "vỡ" khi lên robot thật (kỹ thuật đã bàn ở ASAP/Unitree G1).
Kết: VLA toàn thân là đích đến, data là nút thắt
WholeBodyVLA cho thấy hướng đi của humanoid 2026: một VLA thống nhất điều phối toàn thân, học phần lớn từ video rẻ tiền, thực thi qua RL controller giữ thăng bằng. Đây là nơi tất cả các mảnh của series hội tụ — 3D perception, point-cloud policy, perception toàn cảnh — vào một hệ biết vừa đi vừa thao tác.
Nhưng paper này phơi bày một sự thật: data là nút thắt. Video action-free rẻ nhưng thiếu nhãn action; teleop chính xác nhưng đắt. Làm sao chọn đúng chiến lược thu data cho ngân sách của bạn? Đó là toàn bộ nội dung bài 6.
Bài viết liên quan
- Bài 4: Omni-Manip & spatial reasoning cho humanoid — Perception toàn cảnh nuôi VLA toàn thân
- Bài 6: Thu data — teleop vs robot-free vs video — Giải nút thắt data của VLA
- GR00T N1 + Unitree G1: kiến trúc whole-body VLA — So sánh kiến trúc decoupled tay/chân


