VnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
VnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam
VnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
  1. Trang chủ
  2. Blog
  3. UCAG-P: Một Policy VLA Cho Mọi Robot (98.3% LIBERO)
aivlacross-embodimentcamera-centricqwen3-vlliberomanipulationpre-traininghumanoidlerobot

UCAG-P: Một Policy VLA Cho Mọi Robot (98.3% LIBERO)

UCAG-P của Xiaomi dùng camera-centric action geometry để pre-train một VLA policy duy nhất cho robot arm, humanoid và bàn tay người — đạt 98.3% trên LIBERO không cần fine-tuning riêng.

Nguyễn Anh Tuấn30 tháng 8, 202612 phút đọc
UCAG-P: Một Policy VLA Cho Mọi Robot (98.3% LIBERO)

Thử tưởng tượng bạn muốn train một AI có thể điều khiển robot cánh tay đơn, humanoid hai tay, và thậm chí bàn tay con người — tất cả bằng một checkpoint duy nhất, không cần fine-tuning lại cho từng loại. Đó là bài toán mà UCAG-P giải quyết.

Vào ngày 26 tháng 8 năm 2026, nhóm Xiaomi Embodied Intelligence Team cùng Đại học Macau công bố paper "One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation" — một VLA framework đạt 98.3% trên LIBERO và 89.2% trên RoboTwin Hard với một checkpoint duy nhất, không dùng bất kỳ fine-tuning benchmark-specific nào.

Khuyến nghị công cụ

Stack train/deploy cho VLA

Train trên cloud/workstation, deploy bản tối ưu xuống Jetson hoặc robot computer.

Cloud GPU for VLA / policy training Dùng cho imitation learning, diffusion policy, RL và fine-tuning model robotics. Xem cloud GPU → NVIDIA Jetson Orin NX / Orin Nano Máy deploy edge cho perception, logging và inference đã tối ưu. Xem Jetson → Hugging Face / robotics dataset hosting Lưu dataset, checkpoint và model card để workflow LeRobot/VLA dễ chia sẻ hơn. Xem platform →

Vấn Đề: Tại Sao Cross-Embodiment Lại Khó?

Trước khi đi vào UCAG-P, hãy hiểu tại sao việc train một policy chung cho nhiều loại robot lại khó như vậy.

Mỗi loại robot có không gian hành động (action space) khác nhau hoàn toàn:

  • Robot arm đơn (single-arm): hành động là 6-7 giá trị joint angles hoặc Cartesian velocity
  • Humanoid bimanual: 2 cánh tay với 12-14 bậc tự do, cộng thêm bàn tay
  • Bàn tay con người (dexterous hand): ngón tay với hàng chục bậc tự do

Khi bạn cố gắng gộp dữ liệu từ tất cả các embodiment này, câu hỏi đặt ra là: bạn dùng action space nào làm "ngôn ngữ chung"? Nếu dùng joint angles của robot arm, bàn tay người không có joint angles đó. Nếu dùng Cartesian coordinates, bạn vẫn cần ánh xạ từ mỗi embodiment sang — và ánh xạ này không đơn giản.

Hầu hết các approach cũ giải quyết bằng cách:

  1. Train riêng từng model cho từng embodiment → tốn tài nguyên, không có transfer learning
  2. Dùng một action space "giả chung" (vd: residual actions) → mất đi thông tin embodiment-specific
  3. Chỉ train trên robot data → bỏ qua kho dữ liệu khổng lồ từ video bàn tay người

UCAG-P đề xuất một câu trả lời hoàn toàn khác: thay vì tìm action space chung, hãy tìm geometric space chung mà camera có thể quan sát được.

Ý Tưởng Cốt Lõi: Camera Thấy Gì, Dùng Cái Đó

Bất kể là robot arm hay humanoid hay bàn tay người, camera gắn trên tay (wrist camera) hay trên đầu (head camera) luôn thấy chuyển động của đầu cổ tay và đầu ngón tay. Đây là thứ UCAG-P khai thác.

Giới thiệu UCAG-P — camera-centric action representation
Giới thiệu UCAG-P — camera-centric action representation
Hình 1: UCAG-P thống nhất robot arm, humanoid và bàn tay người thông qua camera-centric anchor motion — nguồn: UCAG-P project page

Thay vì predict joint angles hay Cartesian velocity, UCAG-P predict chuyển động của 2 điểm anchor trong không gian camera:

  • p₀: Điểm cổ tay (wrist) hoặc đầu end-effector
  • p₁: Điểm trung tâm gripper hoặc điểm grasp center

Hai điểm này luôn quan sát được từ camera, dù là robot arm, humanoid, hay bàn tay người. Và từ chuyển động của hai điểm này, một module translator sẽ chuyển đổi thành lệnh điều khiển cụ thể cho từng embodiment.

Đây là insight đơn giản nhưng rất mạnh: camera-observable geometry làm cầu nối giữa các embodiment.

Kiến Trúc UCAG-P: Ba Thành Phần

UCAG-P có kiến trúc gồm 3 thành phần chính:

Kiến trúc UCAG-P với 3 thành phần
Kiến trúc UCAG-P với 3 thành phần
Hình 2: Ba thành phần của UCAG-P: VLM backbone, Shared Motion Head, và Geometry-Conditioned Action Translator — nguồn: UCAG-P project page

1. Vision-Language Backbone (Qwen3-VL-4B-Instruct)

UCAG-P dùng Qwen3-VL-4B-Instruct làm backbone — encode hình ảnh từ nhiều camera và ngôn ngữ instruction. Điểm đặc biệt là backbone có thêm learnable action-query tokens để extract compact feature cho action prediction.

Backbone này xử lý:

  • Hình ảnh RGB đa góc nhìn (multi-view)
  • Language instruction dạng text
  • Output: hidden states + action-query features

2. Shared Camera-Centric Motion Head

Đây là trái tim của UCAG-P — motion head chung predict geometric action chunks cho mọi embodiment.

Action vector có 30 chiều mỗi timestep:

  • Left manipulator motion (10D): 3D displacement của p₀, 3D displacement của p₁, rotation, gripper state
  • Right manipulator motion (10D): tương tự
  • Camera motion (10D): encode camera ego-motion

Tất cả displacements đều được tính tương đối với frame đầu tiên trong camera coordinate system — điều này đảm bảo representation nhất quán giữa các embodiment.

Motion head được train với geometric supervision khi nào camera-centric labels có sẵn. Điều thú vị là cả robot data lẫn human hand data đều có thể cung cấp labels này — robot qua forward kinematics, bàn tay người qua hand keypoint detection.

3. Geometry-Conditioned Action Translator

Đây là module "dịch thuật" từ geometric motion sang lệnh điều khiển cụ thể. Translator nhận:

  • Predicted camera-frame motion (từ motion head)
  • Camera-to-base transforms (calibration)
  • Local Jacobians (robot-specific)
  • Geometry tokens: vector encode cấu trúc embodiment

Geometry tokens là thứ cho translator biết nó đang làm việc với robot arm, humanoid, hay bàn tay người. Với robot arm, translator dùng Jacobian-based IK để convert Cartesian motion thành joint velocity. Với humanoid, nó xử lý cả hai tay đồng thời.

Không gian hành động chung trong camera coordinate
Không gian hành động chung trong camera coordinate
Hình 3: Shared camera-centric action space — robot arm, humanoid và bàn tay người đều được biểu diễn trong cùng geometric space — nguồn: UCAG-P project page

Pipeline Training Ba Giai Đoạn

UCAG-P không train một lần duy nhất mà theo 3 giai đoạn có thứ tự:

Giai đoạn 1: Camera-Centric Specialization

Train VLM backbone + motion head trên toàn bộ dữ liệu có geometric supervision. Mục tiêu: dạy model predict camera-centric anchor motion một cách chính xác, bất kể embodiment.

Ở giai đoạn này, translator chưa tham gia — model chỉ học "thấy scene + instruction → predict chuyển động p₀, p₁ trong camera space".

Giai đoạn 2: Geometry-Conditioned Translation

Train translator bằng ground-truth camera trajectories và executable command labels. Giai đoạn này isolate việc học ánh xạ từ geometric motion sang embodiment-specific commands.

Translator học: "biết chuyển động geometric là thế này, robot cụ thể có Jacobian thế này → joint velocity là thế kia".

Giai đoạn 3: Joint Optimization

Train đồng thời motion head + translator trên mixed robot-human data. Đây là giai đoạn mô phỏng điều kiện inference thực tế — motion head predict, translator translate, cả hai được update cùng nhau.

Thiết kế 3 giai đoạn này rất quan trọng: nếu train tất cả từ đầu cùng lúc, gradient từ translator có thể làm nhiễu việc học geometric representation của motion head.

Dữ Liệu Training: 6,373 Giờ Từ 11 Dataset

Quy mô dữ liệu của UCAG-P rất ấn tượng:

Loại Giờ Tỷ lệ Nguồn
Real robot 266.3h 4.2% RoboChallenge, RoboCoin, DROID
Simulation 3,767.5h 59.1% RoboCasa GR-1, LIBERO, RoboTwin 2.0, InternData
Human hand 2,339.7h 36.7% VITRA, EgoDex, EgoVerse
Tổng 6,373.6h 100% 11 datasets, 9 embodiments

Điểm đặc biệt là 36.7% dữ liệu là từ bàn tay người — không phải robot. Đây là lợi thế lớn của camera-centric approach: video tay người trên YouTube, EgoVerse, EgoDex đều có thể được khai thác trực tiếp mà không cần teleoperation hay annotation phức tạp.

Trong UCAG-P framework, bàn tay người được coi là một embodiment khác trong cùng geometric space. Wrist keypoint của tay người → p₀, thumb-index midpoint → p₁. Chuyển động của chúng trong camera frame được dùng y chang như robot data.

Kết Quả Benchmark: Vượt Trội Trên Mọi Bài Test

Kết quả benchmark UCAG-P so với các baseline
Kết quả benchmark UCAG-P so với các baseline
Hình 4: UCAG-P đạt kết quả vượt trội trên LIBERO, RoboTwin, và RoboCasa với một checkpoint duy nhất — nguồn: UCAG-P project page

Một checkpoint duy nhất, không fine-tuning benchmark-specific:

LIBERO (98.3% tổng):

Subset Score
LIBERO-Spatial 98.8%
LIBERO-Object 98.6%
LIBERO-Goal 99.2%
LIBERO-Long 96.4%
LIBERO Trung bình 98.3%

Các benchmark khác:

Benchmark Score
RoboTwin Easy 88.7%
RoboTwin Hard 89.2%
LIBERO-Plus (zero-shot) 82.0%
RoboCasa GR-1 62.0%

Con số đáng chú ý nhất là 82.0% zero-shot trên LIBERO-Plus — đây là benchmark kiểm tra khả năng generalization với distractor objects và thay đổi background. Model chưa từng thấy LIBERO-Plus trong training mà vẫn đạt 82%, cho thấy camera-centric representation thực sự học được geometric understanding, không phải chỉ memorize.

Trên RoboTwin Hard (dual-arm manipulation với nhiễu từ các object ngẫu nhiên), UCAG-P đạt 89.2% — cao hơn nhiều so với các generalist baseline dùng native action space.

Kết Quả Real-World: Thực Nghiệm Trên Robot Piper

Nhóm tác giả cũng test trên robot Piper thực tế với 3 task:

Kết quả thực nghiệm trên robot thực
Kết quả thực nghiệm trên robot thực
Hình 5: UCAG-P trên robot Piper thực tế — bread grasping, drawer opening, bowl stacking — nguồn: UCAG-P project page

Task Success Rate
Bread grasping 60%
Drawer opening 90%
Bowl stacking 75%

Drawer opening đạt 90% — task này đòi hỏi precise contact và force estimation, khó hơn nhiều so với grasping open objects. Kết quả này cho thấy geometric representation đủ chính xác để handle contact-rich manipulation.

Cross-Embodiment Transfer

Một trong những test quan trọng nhất: train trên ALOHA, test zero-shot trên ARX robot.

ALOHA và ARX là hai robot bimanual với cơ học khác nhau (kinematics khác, workspace khác, joint limits khác). UCAG-P đạt 35% zero-shot success trên ARX sau khi chỉ train với ALOHA data.

35% nghe có vẻ thấp, nhưng đây là zero-shot — không có bất kỳ dữ liệu ARX nào trong training. Baseline dùng native action space (joint angles của ALOHA) sẽ fail hoàn toàn vì joints không tương thích. Điều này chứng minh rằng camera-centric representation thực sự học được transferable manipulation geometry.

Human-to-robot transfer cũng được test: UCAG-P có thể học từ video tay người rồi transfer sang robot arm với tốc độ gấp 2 lần (2× speed) so với chỉ dùng robot data.

Hạn Chế Và Hướng Tương Lai

Nhóm tác giả thành thật liệt kê các hạn chế:

  1. Phụ thuộc camera calibration: Geometry translator cần camera-to-base transforms chính xác. Nếu calibration sai, translation sẽ sai theo. Đây là vấn đề thực tế quan trọng khi deploy.

  2. Hand keypoint detection: Với human data, cần detect wrist và finger keypoints chính xác. Các video tối, góc nhìn xấu sẽ làm keypoint detection fail → labels sai.

  3. Morphology mismatch: Dù có geometry translator, những robot có kinematics quá khác nhau (vd: delta robot vs SCARA) vẫn khó transfer. 35% zero-shot là tốt, nhưng chưa đủ cho production.

  4. Code chưa release: Tại thời điểm viết bài, code, model weights và training scripts chưa được release. Nhóm tác giả cam kết sẽ release sớm tại GitHub.

So Sánh Với Các Approach Cross-Embodiment Khác

UCAG-P không phải approach cross-embodiment đầu tiên. So sánh nhanh:

Approach Action Space Human Data Cross-embodiment
DyPeS Latent + Dynamics Prior ❌ Robot-to-robot
X-VLA Embodiment token ❌ Robot-to-robot
HEX-VLA Whole-body joint Một phần Humanoid
UCAG-P Camera-centric geometric ✅ (36.7% data) Robot + Human + Humanoid

Lợi thế lớn nhất của UCAG-P là tận dụng được human hand data — một kho dữ liệu khổng lồ mà hầu hết các approach khác bỏ qua. Với 2,339 giờ EgoDex, EgoVerse, VITRA, model có thể học manipulation geometry từ videos hàng ngày mà không cần teleoperation.

Chuẩn Bị Sử Dụng UCAG-P

Code chưa release tại thời điểm viết, nhưng đây là những gì bạn cần chuẩn bị khi code ra:

Phần cứng tối thiểu:

  • GPU 24GB+ VRAM để fine-tune (RTX 3090/4090 hoặc A100)
  • Camera wrist với độ phân giải tối thiểu 640×480
  • Calibration setup để lấy camera-to-base transforms

Data pipeline (4 bước):

  1. Episode indexing: Index toàn bộ episodes theo embodiment type
  2. Visual/language standardization: Chuẩn hóa format ảnh, tokenize instruction
  3. Geometric alignment: Compute camera-centric anchor trajectories (p₀, p₁)
  4. Temporal windowing: Sliding window với masking cho labels không có sẵn

Đây là hướng dẫn fine-tune VLA trên LIBERO để làm quen với infrastructure trước khi UCAG-P code release.

Kết Luận

UCAG-P đại diện cho một paradigm shift quan trọng trong robot learning: thay vì cố gắng align action spaces (điều phụ thuộc vào hardware cụ thể), hãy align qua geometric observation (điều mà camera luôn có thể cung cấp).

Kết quả 98.3% LIBERO, 89.2% RoboTwin Hard, và 82.0% zero-shot LIBERO-Plus với một checkpoint duy nhất không phải ngẫu nhiên — đó là validation rõ ràng rằng camera-centric geometric representation là một inductive bias đúng đắn cho generalist robot policies.

Điều thú vị nhất không phải là performance số cao, mà là triết lý thiết kế: bàn tay người cũng là một embodiment. Khi bạn xóa ranh giới đó, bạn mở ra khả năng khai thác hàng triệu giờ video egocentric bình thường để train robot. Đó là đòn bẩy dữ liệu mà không phương pháp nào khác trong lĩnh vực cross-embodiment hiện tại có được.

Paper: arXiv 2608.26058 — Project page: public-bots.github.io/UCAG-P


Bài Viết Liên Quan

  • DyPeS: VLA Cross-Embodiment với Dynamics Prior và MoE
  • HEX-VLA: Cross-Embodiment Policy Cho Humanoid Whole-Body
  • Fine-tune VLA Trên LIBERO với Embodied-R1.5
NT

Nguyễn Anh Tuấn

Robotics & AI Engineer. Building VnRobo — sharing knowledge about robot learning, VLA models, and automation.

Khám phá VnRobo

Fleet MonitoringROS 2 IntegrationAMR Solutions

Bài viết liên quan

Tutorial
ω-0: Latent Predictive WAM cho Humanoid Loco-Manipulation
humanoidwhole-body-controlworld-action-model
ai

ω-0: Latent Predictive WAM cho Humanoid Loco-Manipulation

Hướng dẫn kiến trúc và cách train ω-0 — mô hình latent predictive WAM giúp humanoid robot vừa đi vừa gắp đồ cùng lúc, đạt 81.8% trên 11 tác vụ gia đình.

10/8/202614 phút đọc
NT
Tutorial
OpenHLM: Công Thức VLA Humanoid Loco-Manip Vượt GR00T N1.6
vlahumanoidloco-manipulation
ai

OpenHLM: Công Thức VLA Humanoid Loco-Manip Vượt GR00T N1.6

OpenHLM (arXiv 2606.22174): 3 pha thực nghiệm — teleoperation 32-DOF, VLA π0.5, HuMI co-training — giúp Unitree G1 vượt GR00T N1.6 với chưa đến nửa số demo.

8/7/202613 phút đọc
NT
Tutorial
X-VLA ICLR 2026: Soft-Prompted VLA 0.9B cho beginner LeRobot
x-vlavlaiclr-2026
wholebody-vla

X-VLA ICLR 2026: Soft-Prompted VLA 0.9B cho beginner LeRobot

Hướng dẫn X-VLA — flow-matching VLA 0.9B đạt SOTA trên 6 sim + 3 robot thật, native LeRobot, code open-source HuggingFace.

20/5/202611 phút đọc
NT
VnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam