Series
Vima Humanoid Manip
Series "Vima Humanoid Manip" gồm 5 phần, đọc theo thứ tự từ phần 1.
Manipulation
VIMA: Kiến Trúc Cross-Attention cho Tay Robot
Giải mã kiến trúc cross-attention của VIMA: cách T5 encoder xử lý prompt đa phương thức và XAttn GPT decoder sinh lệnh cho 17 task robot.

VimaBench: 17 Task, 4 Cấp Tổng Quát Hóa
Cài đặt VimaBench, chạy demo 200M checkpoint, và phân tích 4 cấp eval từ placement đến novel task generalization — cấp nào quan trọng nhất cho humanoid?

Object Tokenizer: Từ Pixel Thô đến Token Đối Tượng với Mask R-CNN + ViT
Deep dive object tokenizer của VIMA: Mask R-CNN tách đối tượng, ViT encode crop, bbox MLP giữ vị trí, rồi ghép với T5 prompt.

Dataset 650K: Thu Thập Dữ Liệu Đa Nhiệm Vụ Quy Mô Lớn cho VIMA
Phân tích bộ dataset 650K trajectories của VIMA: procedural generation trong PyBullet, format pkl, cách tải từ HuggingFace, và tại sao 1% dữ liệu đã đủ để vượt baseline.

Humanoid Adaptation: Mở Rộng VIMA lên Robot Hình Người DoF Cao
Capstone series VIMA: adapt từ tabletop 6-DoF lên Unitree G1 23-DoF — freeze backbone, swap action head, bridge data gap với teacher-student và LoRA fine-tuning.