Series
Robot 3d Manipulation Vla
Series "Robot 3d Manipulation Vla" gồm 7 phần, đọc theo thứ tự từ phần 1.
Research & Trends
Vì sao VLA 2D chưa đủ cho manipulation
Policy và VLA chỉ dùng ảnh RGB 2D đang chạm trần: depth ambiguity, occlusion, thiếu metric scale. Bài mở đầu series giải thích vì sao 3D là hướng đi tất yếu và bức tranh toàn cảnh từ DP3 đến WholeBodyVLA.

Robo3R: tái dựng 3D feed-forward cho robot arm
Từ camera RGB thông thường và trạng thái robot, Robo3R dựng hình học 3D metric-scale theo thời gian thực trong robot frame — không cần depth sensor, không cần SLAM, 43 Hz trên single view.

DP3: 3D Diffusion Policy với point cloud (hands-on)
DP3 biến point cloud thành input trực tiếp cho diffusion policy — 24.2% cải thiện trên 72 tasks, 85% success rate trên robot thật. Hands-on: cài đặt, train, eval từ repo YanjieZe/3D-Diffusion-Policy.

Perception 3D cho humanoid: Omni-Manip & spatial reasoning
Humanoid vừa đi vừa với tay ra xa cần perception ngoài FOV camera và active spatial reasoning. Phân tích Omni-Manip và Active Spatial Reasoning — 2 paper humanoid 2026.

WholeBodyVLA: video egocentric + RL loco-manipulation
WholeBodyVLA học từ video egocentric action-free và nối VLA cấp cao với RL controller cấp thấp cho whole-body loco-manipulation. Phân tích paper ICLR 2026, test trên AgiBot X2.

Thu data manipulation: teleop vs robot-free vs video
Ba chiến lược thu dữ liệu whole-body manipulation — teleop, robot-free demo (HuMI), và video egocentric action-free. Bảng so sánh cost/quality/throughput và cách chọn theo ngân sách.

Roadmap 3D manipulation cho humanoid Unitree G1
Bài capstone: ghép Robo3R, DP3, Omni-Manip và WholeBodyVLA thành một pipeline triển khai cụ thể cho Unitree G1 — từ bố trí cảm biến, chọn policy, chọn data, đến checklist sim2real.