AI & Perception
Perception và learning cho hệ thống embodied: computer vision, reinforcement learning, diffusion policy, imitation learning và inference trên edge.
27 bài trong chủ đề này

ω-0: Latent Predictive WAM cho Humanoid Loco-Manipulation
Hướng dẫn kiến trúc và cách train ω-0 — mô hình latent predictive WAM giúp humanoid robot vừa đi vừa gắp đồ cùng lúc, đạt 81.8% trên 11 tác vụ gia đình.

OpenHLM: Công Thức VLA Humanoid Loco-Manip Vượt GR00T N1.6
OpenHLM (arXiv 2606.22174): 3 pha thực nghiệm — teleoperation 32-DOF, VLA π0.5, HuMI co-training — giúp Unitree G1 vượt GR00T N1.6 với chưa đến nửa số demo.

Visualize 23 khớp G1: MCAP bag replay & Layout XML
Dùng plugin DataLoadMCAP trong PlotJuggler để mở file .mcap từ G1, tạo grid multi-panel xem đồng thời q/dq/tau của tất cả 23 khớp, và lưu layout XML để tái dùng qua nhiều session debug.

Motion Planning Tránh Va Chạm: MoveIt2 & OMPL
Hiểu C-space, RRT/RRT-Connect/PRM qua OMPL, dùng MoveGroupInterface C++ và moveit_py Python để plan đường đi tránh vật cản rồi execute trong RViz với MoveIt2.

Ark v1.5: Python Framework cho Robot Learning sim-to-real
Hướng dẫn chi tiết Ark v1.5 — Python framework open-source train ACT + Diffusion Policy seamless giữa sim và robot thật, native ROS, Gym-style API.

Xiaomi-Robotics-0: VLA 4.7B Real-Time trên GPU Consumer
Hướng dẫn cài đặt và chạy Xiaomi-Robotics-0 — VLA 4.7B kết hợp Qwen3-VL và Diffusion Transformer, đạt 80ms inference trên RTX 4090.
Mô hình Dense trong Robotics: Từ DON đến DenseMatcher
Khám phá Dense Object Nets, DenseFusion và DenseMatcher — bộ ba công nghệ dense visual descriptor đang cách mạng hóa cách robot nhìn và cầm nắm vật thể.
Gemma 4 và Ứng Dụng Trong Robotics
Phân tích kiến trúc Gemma 4 của Google — từ on-device AI đến ứng dụng thực tế trong điều khiển robot, perception và agentic workflows.
Gemma 4 cho Robotics: AI mã nguồn mở chạy trên Edge
Phân tích Gemma 4 của Google — mô hình AI mã nguồn mở hỗ trợ multimodal, agentic, chạy trên Jetson và Raspberry Pi cho robotics.
Tự Build Robot Hình Người Dưới $5000 với Berkeley Humanoid Lite
Hướng dẫn chi tiết xây dựng Berkeley Humanoid Lite — robot humanoid in 3D mã nguồn mở từ UC Berkeley, 24 DOF, locomotion bằng RL sim-to-real.

FlashSAC: RL nhanh hơn PPO cho Robot
FlashSAC — off-policy RL mới vượt PPO về tốc độ lẫn hiệu quả trên 100+ tasks robotics, từ humanoid locomotion đến dexterous manipulation.
Sim-to-Real Transfer: Train simulation, chạy thực tế
Kỹ thuật chuyển đổi mô hình từ simulation sang robot thật — domain randomization, system identification và best practices.

Hands-on: Fine-tune OpenVLA với LeRobot
Tutorial thực hành — fine-tune OpenVLA trên custom data, LoRA, quantization và deploy trên robot thật.

SpatialVLA: 3D understanding cho robot manipulation
Tại sao 3D spatial awareness quan trọng cho VLA — Ego3D Position Encoding và Adaptive Action Grids.
Tactile Sensing: Cảm biến xúc giác cho robot manipulation
Tìm hiểu công nghệ cảm biến xúc giác — từ resistive, capacitive đến vision-based tactile và ứng dụng trong gắp vật thể mềm.
VLA Models: RT-2 → Octo → OpenVLA → π0
Lịch sử và evolution của Vision-Language-Action models — mỗi model giải quyết vấn đề gì và trade-offs.
Foundation Models cho Robot: RT-2, Octo, OpenVLA thực tế
Tổng quan foundation models cho robotics — cách RT-2, Octo và OpenVLA thay đổi cách robot học manipulation và navigation.

Diffusion Policy: Cách mạng robot manipulation
Tại sao diffusion models là breakthrough cho robotics — multimodal distributions, high-dim actions và stability.

Action Chunking Transformers (ACT): Kiến trúc chi tiết
Phân tích ACT — tại sao predict nhiều actions cùng lúc tốt hơn, CVAE encoder và temporal ensembling.
Imitation Learning: BC, DAgger và DAPG cho robot
Tại sao imitation learning quan trọng hơn RL cho nhiều bài toán manipulation — cách thu thập data và train policy.
RL cho Robotics: PPO, SAC và cách chọn algorithm
Tổng quan RL algorithms cho robotics — PPO, SAC, TD3 và hướng dẫn chọn algorithm phù hợp cho từng bài toán robot.
Deploy YOLOv8 lên Jetson Orin Nano trong 30 phút
Hướng dẫn step-by-step deploy YOLOv8 với TensorRT lên NVIDIA Jetson Orin Nano — từ export model đến inference real-time 60 FPS.

Reinforcement Learning cho Bipedal Walking: Paper đến thực hành
Cách dùng RL để dạy robot đi hai chân — từ reward design, sim-to-real transfer đến triển khai trên phần cứng thực tế.
Top nghiên cứu Robotics 2024-2025: Paper đáng đọc từ ICRA, CoRL và RSS
Tổng hợp và phân tích các paper robotics có ảnh hưởng lớn nhất — từ foundation models cho robot, dexterous manipulation đến sim-to-real transfer.

Edge AI với NVIDIA Jetson: Triển khai AI trên thiết bị nhúng
Hướng dẫn triển khai Edge AI với NVIDIA Jetson và TensorRT — tối ưu inference real-time cho robot và ứng dụng nhúng.
Xu hướng AI trong Robotics năm 2025: Từ LLM đến Embodied AI
Tổng quan xu hướng AI trong Robotics 2025 — foundation models, sim-to-real transfer, và Embodied AI đang thay đổi ngành.

Ứng dụng Computer Vision trong kiểm tra chất lượng tự động
Hướng dẫn ứng dụng Computer Vision kiểm tra chất lượng tự động với YOLOv8 và camera công nghiệp trên dây chuyền sản xuất.