Manipulation
Cánh tay và bàn tay robot — grasping, dexterous và bimanual manipulation, từ IK cổ điển tới policy học được.
76 bài trong chủ đề này

EvoVLA ECCV 2026: Diệt Stage Hallucination trong VLA
Hướng dẫn EvoVLA (ECCV 2026): giải quyết stage hallucination trong VLA với SAR, Gemini hard negatives và memory dài hạn để đạt 69.2% trên benchmark thao tác dài hạn.

Hướng dẫn VLAC: Huấn luyện VLA với Critic đạt 90% chỉ sau 200 episodes
VLAC tích hợp critic vào vòng lặp RL thực tế, đưa success rate từ 30% lên 90% chỉ sau 200 episodes không cần reward engineering thủ công.

Qwen-VLA: Train Robot Manipulation Đa Nhiệm trên LIBERO Đạt 97.9%
Hướng dẫn kỹ thuật Qwen-VLA từ Alibaba: kiến trúc Qwen3.5-4B + DiT decoder, 4 giai đoạn training, đạt 97.9% trên LIBERO và đánh bại pi0.5 trên ALOHA thực tế.

FM-VLA: Force Memory Dạy VLA Làm Contact-Rich >80%
FM-VLA dùng Variational Autoencoder nén lịch sử cảm biến lực thành 8 memory token, giúp robot nhấn nút đúng số lần, lau chùi, tìm vật che khuất — đạt 83.3% success rate với overhead chỉ 3.3ms.

InstructVLA: VLA Instruction Tuning Vượt OpenVLA 96%
ICLR 2026: InstructVLA dùng VLA-IT với MoE LoRA để train manipulation policy hiểu câu lệnh phức tạp, đạt +96% so với OpenVLA trên SimplerEnv-Instruct 80 task.

LaST-R1: Fine-tune VLA với Latent CoT và RL đạt 99.8%
Hướng dẫn chi tiết LaST-R1 — framework kết hợp Latent Chain-of-Thought reasoning với LAPO (RL) để fine-tune VLA đạt 99.8% success rate trên LIBERO chỉ với 1 demo/task.

UniTacVLA: Xúc Giác Chain-of-Thought cho Robot Manipulation
UniTacVLA tích hợp tactile chain-of-thought và coarse-to-fine prediction vào VLA để xử lý thao tác tiếp xúc phức tạp — ECCV 2026 với code open-source.

TORL-VLA: Fine-tune VLA với Cảm Biến Xúc Giác và Online RL
Hướng dẫn TORL-VLA — framework kết hợp cảm biến xúc giác (tactile) và Online RL để fine-tune VLA cho thao tác tiếp xúc chính xác cao: latch, trứng, cốc cà phê.

Sim-to-Real Deploy: Đưa SAP Pipeline từ LIBERO ra Robot Thật | AI Manipulation Agents #5
Từ 79.6% trên LIBERO benchmark đến robot vật lý thực tế: calibrate camera-to-robot transform, handle domain gap với real-world augmentation, và deploy SAP pipeline trên Franka/UR5 với latency < 100ms.

Object Tokenizer: Từ Pixel Thô đến Token Đối Tượng với Mask R-CNN + ViT
Deep dive object tokenizer của VIMA: Mask R-CNN tách đối tượng, ViT encode crop, bbox MLP giữ vị trí, rồi ghép với T5 prompt.

Dataset 650K: Thu Thập Dữ Liệu Đa Nhiệm Vụ Quy Mô Lớn cho VIMA
Phân tích bộ dataset 650K trajectories của VIMA: procedural generation trong PyBullet, format pkl, cách tải từ HuggingFace, và tại sao 1% dữ liệu đã đủ để vượt baseline.

VIMA: Kiến Trúc Cross-Attention cho Tay Robot
Giải mã kiến trúc cross-attention của VIMA: cách T5 encoder xử lý prompt đa phương thức và XAttn GPT decoder sinh lệnh cho 17 task robot.

VimaBench: 17 Task, 4 Cấp Tổng Quát Hóa
Cài đặt VimaBench, chạy demo 200M checkpoint, và phân tích 4 cấp eval từ placement đến novel task generalization — cấp nào quan trọng nhất cho humanoid?

Dexora: VLA Mã Nguồn Mở cho Robot Hai Tay Khéo Léo
Khám phá Dexora — VLA mã nguồn mở đầu tiên chuyên biệt cho robot thao tác hai tay 36 bậc tự do, kết hợp exoskeleton và Apple Vision Pro để đạt 66.7% thành công trên tác vụ khéo léo.

Tại sao Multi-Agent đánh bại VLA đơn thuần? | AI Manipulation Agents #1
ManiAgent đạt 86.8% trên SimplerEnv — vượt xa pi0 55.7% và CogACT 51.3%. Phân tích kiến trúc 3-agent và lý do phân rã pipeline thắng end-to-end VLA.

Perception Agent: Florence-v2 + AnyGrasp | AI Manipulation Agents #2
Deep dive vào Perception Agent của ManiAgent: Florence-v2 nhận diện vật thể zero-shot qua open-vocabulary detection, AnyGrasp sinh 6-DoF grasp pose từ point cloud. Hướng dẫn Python build perception module hoàn chỉnh.

ALRM: Code-as-Policy vs Tool-as-Policy trong ReAct | AI Manipulation Agents #3
So sánh hai execution mode của ALRM: CaP sinh Python gọi robot API trong một lần chạy, TaP dùng ReAct lặp từng tool call. Benchmark 56 tasks, 10 LLMs — giúp bạn chọn đúng mode cho dự án.

Agentic Robot: SAP Protocol + Temporal Verifier
Chạy ds.py (DeepSeek-V3 decompose subgoals) và main.py (OpenVLA trên LIBERO). Implement Temporal Verifier sliding window — SAP protocol đạt 79.6% LIBERO avg.

Roadmap 3D manipulation cho humanoid Unitree G1
Bài capstone: ghép Robo3R, DP3, Omni-Manip và WholeBodyVLA thành một pipeline triển khai cụ thể cho Unitree G1 — từ bố trí cảm biến, chọn policy, chọn data, đến checklist sim2real.

Mô hình cánh tay robot: joints, links, URDF, DH, SE(3)
Tự điền bảng DH UR5, dựng robot model bằng NumPy/C++ Eigen, rồi đối chiếu với Robotics Toolbox và Pinocchio URDF.

Forward Kinematics từ số 0: DH đến SE(3) bằng C++
Tự tính FK UR5 từ bảng DH, nhân A1...A6 bằng tay, rồi viết NumPy/C++ Eigen và verify bằng GoogleTest, RTB, Pinocchio.

Inverse Kinematics: analytical vs numerical IK
Tự giải IK UR5 bằng tay, rồi viết solver numerical IK Python/C++ với Jacobian pseudo-inverse, DLS và tránh joint-limit.

Jacobian, singularity và resolved-rate control
Tự derive Jacobian UR5, phát hiện singularity bằng SVD và viết resolved-rate controller an toàn bằng Python/C++.
Hệ tọa độ robot: Base, Tool, User Frame và TCP
Giải thích base/tool/user/object frame, TCP 6-DOF và pose composition bằng SpatialMath Python và Eigen C++.

MoveJ: chuyển động trong joint space
Tự viết MoveJ: nội suy joint space, đồng bộ thời gian, tôn trọng giới hạn vận tốc/gia tốc, prototype Python và C++ chạy được.

MoveL: chuyển động thẳng Cartesian với IK
Tự implement MoveL: nội suy TCP theo đường thẳng, SLERP orientation, giải IK từng waypoint và verify độ thẳng path.

Classical Robot Arm Control: Roadmap & Controller Stack
Bản đồ nhập môn controller robot arm cổ điển: MoveJ/MoveL, planner, trajectory, servo loop, C++/Python và thư viện 2026.

MoveC và MoveP: cung tròn và đường quá trình
Tự dựng MoveC qua 3 điểm và MoveP qua nhiều via point với tốc độ TCP ổn định, blend radius, Python prototype và C++ Eigen.

Profile vận tốc: trapezoid vs S-curve
Time-scaling cho robot arm: trapezoid, S-curve, giới hạn vận tốc/gia tốc/jerk, Python prototype và C++ class.

Blending waypoint: bo góc mượt giữa các đoạn
Hiểu blend radius, path deviation, vì sao robot chậm khi dừng ở mọi waypoint, rồi dựng Python/C++ cho chuyển động đa điểm mượt.

Jogging và servo control: jog khớp và twist TCP
Hướng dẫn chi tiết MoveIt Servo trên ROS 2: joint jog, Cartesian twist jog, pose tracking thời gian thực, an toàn singularity/collision, C++ API và Python teleop keyboard.

ROS2 control & robot thật: ros2_control + UR RTDE
Bài capstone: deploy controller lên UR robot thật qua ros2_control, joint_trajectory_controller và ur_rtde C++ với logging tracking error đầy đủ.

Dựng project C++ cho robot controller: CMake & Eigen
Setup C++/CMake/Eigen, GoogleTest và Python env để làm nền cho robot arm controller trong toàn bộ series.

DP3: 3D Diffusion Policy với point cloud (hands-on)
DP3 biến point cloud thành input trực tiếp cho diffusion policy — 24.2% cải thiện trên 72 tasks, 85% success rate trên robot thật. Hands-on: cài đặt, train, eval từ repo YanjieZe/3D-Diffusion-Policy.
Scene mapping cho cuRobo: depth camera, TSDF/ESDF và obstacle snapshot
Cách đưa thế giới thật vào cuRobo planner: cuboid trước, depth sau, timestamp, filtering, TSDF/ESDF và chiến lược snapshot để tránh planner dùng scene cũ.
Upgrade lên D405: khi nào nên thay GoPro trong UMI và cách làm
Hướng dẫn thực dụng để quyết định khi nào nên upgrade từ GoPro UMI sang RealSense D405: những gì D405 mang lại, những gì bạn phải tự xây, và kiến trúc đúng để không mất data quality.

Build RUKA-v2: bàn tay robot 16-DOF
Hướng dẫn build RUKA-v2, bàn tay robot open-source tendon-driven cho teleoperation, dexterous manipulation và policy learning.

AffordanceVLA: VLA hiểu affordance
Hướng dẫn AffordanceVLA từ paper mới, kiến trúc Which2Act/Where2Act/How2Act, cài đặt GitHub, training, inference và kết quả.

Lên hai tay: UMI bimanual pipeline với scripts chính thức
Scale UMI lên bimanual: in 2 unit, thu demo với cả hai tay, dùng demo_real_bimanual_robots.py và eval_real_bimanual_umi.py chính thức, train với config umi_bimanual. Cụ thể, step-by-step, không guesswork.

Chạy OpenEAI-VLA pretrained với Qwen3-VL
Hướng dẫn cài đặt, chạy inference và fine-tune OpenEAI-VLA, VLA mã nguồn mở dựa trên Qwen3-VL-4B cho robot arm giá rẻ.

Chạy FineVLA cho robot dual-arm
Hướng dẫn FineVLA: ý tưởng paper, kiến trúc, cài đặt, training, inference và kết quả cho VLA dual-arm.
ROS 2 bridge cho cuRobo trên Jetson: từ goal pose tới JointTrajectory
Thiết kế node ROS 2 bọc cuRobo planner: topic/service/action, lifecycle warmup, joint state reorder, trajectory retiming và watchdog.

EXPO-FT: RL Online Cho VLA π0.5
Hướng dẫn EXPO-FT mã nguồn mở: fine-tune VLA π0.5 bằng RL online với chỉ 19.1 phút dữ liệu robot thật.

Train Diffusion Policy đầu tiên với UMI và test trên robot arm
Hướng dẫn train Diffusion Policy từ replay_buffer.zarr.zip của UMI, đọc hiểu training metrics, và deploy policy lên robot arm thật với eval_real_umi.py — dùng configs chính thức đã được verify.
Motion planning và grasp với cuRobo: obstacle, seed và trajectory
Hướng dẫn chạy pose-to-pose planning, obstacle collision, warmup, grasp approach-lift và cách tune planner cho robot arm trên Jetson.

Thu demo đơn tay với UMI và chạy SLAM pipeline chính thức
Hướng dẫn từng bước thu demo UMI đơn tay, chạy toàn bộ 8 script SLAM pipeline chính thức (00-07), kiểm tra chất lượng data, và xuất replay_buffer.zarr.zip để train policy.

Lắp UMI gripper đầu tiên: in 3D, assembly, và smoke test GoPro
Hướng dẫn từng bước để in 3D và lắp ráp một UMI handheld unit với GoPro — đường đi đã được kiểm chứng từ repo Stanford. BOM đầy đủ, print settings, và cách test trước khi thu demo đầu tiên.
FK và IK trong cuRobo: kiểm tra frame, quaternion và joint order
Bài thực hành kiểm tra forward kinematics, inverse kinematics, quaternion wxyz, joint order và lỗi frame thường gặp trước khi chạy planner trên robot thật.
UMI là gì? Cách thu data VLA cho robot mà không cần teleop
Hiểu được ý tưởng cốt lõi của Universal Manipulation Interface: tại sao tách data collection ra khỏi robot lại là bước đột phá giúp scale imitation learning cho manipulation.
Build robot model cho cuRobo: URDF, collision spheres và self-collision
Cách chuyển URDF robot arm thành config cuRobo dùng được: mesh path, sphere fitting, self-collision ignore matrix, clipping link và tiêu chí pass/fail.
Cài cuRoboV2 trên Jetson AGX Orin 64GB: môi trường, CUDA và kiểm tra
Thiết lập môi trường cuRoboV2 trên Jetson AGX Orin 64GB theo hướng reproducible: JetPack, uv, Python 3.11, CUDA 12.x, PyTorch và smoke test.

Multitask DiT Policy LeRobot v0.5: 1 model nhiều task
Hướng dẫn Multitask DiT Policy của LeRobot v0.5: train 1 policy cho nhiều task với CLIP text-conditioning, code open-source HuggingFace, deploy SO-100/SO-101.
cuRobo trên Jetson AGX Orin 64GB và Unitree G1: lộ trình 10 bài
Bài mở đầu series: cuRoboV2 dùng để làm gì, khi nào chạy trên Jetson AGX Orin 64GB, khi nào dùng workstation, và kiến trúc deploy cho robot arm lẫn Unitree G1.

Hướng dẫn SO-101 sim-to-real với Isaac Lab & LeRobot
Từng bước train cánh tay SO-101 trong NVIDIA Isaac Lab, thu thập dữ liệu teleop, fine-tune GR00T N1.5, và deploy policy lên robot thực tế.

RoboTwin 2.0: Hướng dẫn toàn diện dual-arm manipulation
Khám phá RoboTwin 2.0 — framework tạo dữ liệu synthetic quy mô lớn cho robot hai tay, với domain randomization mạnh và pipeline MLLM code generation tự động.

Task Planning cho Manipulation trên Jetson Edge
Hướng dẫn triển khai task planning cho robot manipulation trên NVIDIA Jetson AGX Orin 64GB — từ cuTAMP, cuMotion đến VLM inference.
Multi-Step Manipulation: Curriculum Learning cho Long-Horizon
Giải quyết manipulation dài hơi bằng RL — curriculum learning, hierarchical RL, skill chaining, và benchmark IKEA furniture assembly.
Tool Use: Robot học sử dụng dụng cụ bằng RL
Dạy robot sử dụng dụng cụ bằng RL — affordance learning, two-phase grasp-then-use, và screwdriver insertion trong MuJoCo.

Contact-Rich Manipulation: Assembly, Insertion và Peg-in-Hole
Giải quyết contact-rich manipulation bằng RL — peg-in-hole, assembly, tactile sensing, và domain randomization cho sim-to-real.
Bê và vận chuyển vật thể: Ổn định trong di chuyển
Huấn luyện robot bê vật thể ổn định bằng RL — từ carry-flat đến pouring, multi-objective reward cho speed vs stability.
Pick-and-Place chính xác: Position và Orientation Control
Huấn luyện robot pick-and-place chính xác dưới 1cm với RL — HER cho sparse rewards, 6-DOF placement, và orientation alignment.

Force Control bằng RL: Giữ cốc nước thăng bằng
Huấn luyện robot giữ cốc nước không đổ bằng RL — reward design cho force control, impedance control baseline, và SAC training.
Grasping với RL: Stable Grasp và Object Variety
Huấn luyện robot nắm vật thể đa dạng bằng RL — từ reward design cho grasping đến curriculum learning với PPO và SAC.
RL cho Manipulation: MDP, Reward Design và Environment Setup
Xây dựng nền tảng RL cho manipulation — từ MDP formulation, thiết kế reward function đến setup môi trường MuJoCo từ đầu.

ROS 2 từ A đến Z (P5): ros2_control và Hardware
Kết nối ROS 2 với phần cứng thực — viết hardware interface C++ cho motor driver và đọc encoder với ros2_control framework (Jazzy, cập nhật 6/2026).

Xây dựng hệ thống manipulation với LeRobot
End-to-end tutorial: setup LeRobot, record demonstrations, train policy (ACT/Diffusion), evaluate và deploy lên robot arm thật.

Bimanual Manipulation: Dạy robot dùng 2 tay
ALOHA hardware, Mobile ALOHA, ACT for bimanual tasks, data collection tips và LeRobot SO-100 dual arm -- hướng dẫn đầy đủ về bimanual manipulation.

MoveIt2: Motion Planning cho robot arm với ROS 2
Hướng dẫn cấu hình MoveIt2 cho robot arm — từ URDF, collision detection đến trajectory planning trong ROS 2.

Dexterous Manipulation: Thao tác bàn tay robot
In-hand rotation, tool use, DexGraspNet và tactile sensing -- hướng dẫn toàn diện về dexterous manipulation với multi-finger robot hands.

VLA cho Manipulation: RT-2, Octo, pi0 thực tế
Vision-Language-Action models đang thay đổi manipulation -- từ RT-2 của Google đến pi0 của Physical Intelligence, cách fine-tune và hạn chế thực tế.

Diffusion Policy thực hành: Từ lý thuyết đến code
DDPM recap, Diffusion Policy architecture (CNN vs Transformer), code với LeRobot, và benchmark results -- hướng dẫn thực hành đầy đủ.

Imitation Learning cho Manipulation: BC, DAgger, ACT
Data collection bằng teleoperation, Behavioral Cloning pipeline, DAgger fix distribution shift, và ACT -- tất cả để dạy robot manipulation từ demonstrations.

Robot Grasping 101: Analytical đến learning-based
Từ force closure truyền thống đến deep learning grasp detection -- tổng quan các phương pháp grasping hiện đại và cách chọn đúng cho project.
Inverse Kinematics robot arm 6 bậc: Lý thuyết + Python
Giải bài toán IK cho robot arm 6-DOF — từ DH parameters, forward kinematics đến numerical IK solver với Python và NumPy.
Top 5 Cobot 2026: UR vs Doosan vs FANUC vs ABB vs Techman
So sánh 5 hãng cobot phổ biến nhất — payload, tầm với, giá thành và ứng dụng thực tế cho nhà máy Việt Nam.
Lập trình điều khiển robot với Python: Từ cơ bản đến nâng cao
Python là ngôn ngữ phổ biến nhất trong robotics nhờ hệ sinh thái thư viện phong phú. Tìm hiểu cách điều khiển robot từ GPIO đến kinematics.