VnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
VnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam
VnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
  1. Trang chủ
  2. Blog
  3. T-Rex: VLA xúc giác nhanh với LeRobot v3
wholebody-vlat-rexvlatactilelerobot-v3dexterous-manipulationqwen3-vlvq-vaebimanual

T-Rex: VLA xúc giác nhanh với LeRobot v3

Hướng dẫn T-Rex: VLA xúc giác phản ứng nhanh cho thao tác khéo léo, dataset LeRobot v3.0, training, inference và kết quả.

Nguyễn Anh Tuấn5 tháng 8, 202616 phút đọc
T-Rex: VLA xúc giác nhanh với LeRobot v3

T-Rex: VLA xúc giác phản ứng nhanh cho thao tác khéo léo với LeRobot v3.0

Nếu robot chỉ nhìn bằng camera, nó có thể biết quả trứng nằm ở đâu, cuốn sách đang mở trang nào, hoặc bóng đèn nằm trên bàn. Nhưng khi robot bắt đầu chạm vào vật, camera không còn đủ nhanh và đủ chính xác. Lực kẹp tăng quá mạnh có thể làm vỡ trứng. Ngón tay trượt nhẹ trên mép giấy có thể khiến thao tác lật trang thất bại. Bóng đèn cần mô-men vừa đủ để xoay vào ren, nhưng không được nghiêng lệch hoặc siết sai hướng. Đây là vùng mà tactile feedback quan trọng hơn cả visual planning.

T-Rex: Tactile-Reactive Dexterous Manipulation là một paper/project mới từ UC Berkeley, NVIDIA, Stanford và nhiều cộng tác viên, công bố trên arXiv 2606.17055. Project page chính thức ở tactile-reactive-dexterous.github.io, code ở ZhuoyangLiu2005/T-Rex, dataset public ở Hugging Face zekaiwang/trex_dataset. Điểm đáng chú ý nhất: nhóm tác giả không chỉ thêm tactile token vào VLA rồi hy vọng model tự học. Họ thiết kế lại cả dữ liệu, kiến trúc và inference loop để robot có hai nhịp phản ứng: nhịp chậm cho vision-language-action planning và nhịp nhanh cho tactile refinement.

Khuyến nghị công cụ

Stack train/deploy cho VLA

Train trên cloud/workstation, deploy bản tối ưu xuống Jetson hoặc robot computer.

Cloud GPU for VLA / policy training Dùng cho imitation learning, diffusion policy, RL và fine-tuning model robotics. Xem cloud GPU → NVIDIA Jetson Orin NX / Orin Nano Máy deploy edge cho perception, logging và inference đã tối ưu. Xem Jetson → Hugging Face / robotics dataset hosting Lưu dataset, checkpoint và model card để workflow LeRobot/VLA dễ chia sẻ hơn. Xem platform →

Về mặt thực dụng, T-Rex đáng đọc vì repo đã release post-training và inference code, checkpoint pretrain/midtrain trên Hugging Face, và đường dữ liệu LeRobot v3.0. Bạn không cần tự tái tạo 22.889 giờ human egocentric pretraining hay toàn bộ mid-training nội bộ để bắt đầu. Use case hợp lý cho lab nhỏ là: dùng checkpoint midtrain đã release, chuẩn bị vài chục đến khoảng 100 demo cho task riêng, convert dữ liệu sang JSON hoặc LeRobot v3.0, post-train, rồi chạy inference server slow/fast để điều khiển robot có tactile sensors.

Ý tưởng chính của paper

T-Rex bắt đầu từ một nhận xét rất đơn giản: con người thao tác khéo léo bằng cả mắt và da. Mắt giúp ta xác định mục tiêu, lập kế hoạch thô, hiểu semantic instruction. Nhưng trong vài chục mili-giây cuối khi đầu ngón tay chạm vật, da mới là cảm biến quyết định. Khi bạn rút một lá bài khỏi khe, tactile signal cho biết cạnh bài đã kẹt, đang trượt hay đã thoát. Khi bạn đặt viên thuốc vào hộp, tactile feedback cho biết ngón tay đang ép quá mạnh hay vật đã vào đúng vị trí.

Các VLA phổ biến thường có một trong hai vấn đề. Một là bỏ qua tactile hoàn toàn, chỉ dùng RGB, proprioception và language. Hai là thêm tactile như một modality tĩnh, ở cùng tốc độ với visual encoder. Cách thứ hai nghe có vẻ đúng nhưng vẫn chưa đủ, vì tactile là tín hiệu high-frequency. Force, torque, shear và local deformation có thể thay đổi nhanh hơn tốc độ mà VLM backbone xử lý ảnh. Nếu bắt tactile phải chờ vision stack chạy lại, robot đã phản ứng muộn.

T-Rex giải quyết bằng ba quyết định:

  1. Dataset tactile-rich quy mô lớn: 100 giờ teleoperation bimanual dexterous manipulation, tổ chức quanh 22 motor primitives và hơn 200 vật thể thường ngày. Repo/project cho biết khoảng 50 giờ, hơn 5.400 trajectories được open-source theo LeRobotDataset v3.0.
  2. Variable-rate Mixture-of-Transformers (MoT): model có latent expert, action expert và tactile expert chạy ở các nhịp khác nhau. Action expert lập kế hoạch chậm hơn, khoảng 5 Hz; tactile expert tinh chỉnh nhanh hơn, khoảng 20 Hz.
  3. Temporal tactile VQ-VAE: tactile F6 history từ 10 đầu ngón tay được nén thành token rời rạc ổn định, giúp model đọc được pattern động như trượt, tăng lực, biến dạng, thay vì chỉ nhìn một frame tactile tĩnh.
T-Rex teaser video — nguồn: project page T-Rex

Điểm mới không nằm ở việc "robot có cảm biến lực". Robotics đã có tactile sensing từ lâu. Điểm mới là công thức để tactile đi vào một foundation-style VLA mà không phá vỡ khả năng planning của visual-language backbone. T-Rex giữ nhịp slow để hiểu task và nhịp fast để sửa hành động trong cùng action chunk.

Dataset T-Rex theo LeRobot v3.0

Dataset là phần rất quan trọng vì tactile-reactive policy không thể học tốt chỉ từ vài video. Theo project page, dữ liệu được thu trên robot Dexmate Vega-1 bimanual: hai arm 7-DoF, hai Sharpa Wave dexterous hands 22-DoF, tổng benchmark trên nền tảng 58-DoF. Perception gồm head ZED X Mini stereo camera và hai wrist camera góc rộng. Tactile đến từ 10 fingertip sensors, mỗi tay 5 đầu ngón, cung cấp raw grayscale tactile images, estimated deform maps và estimated 6D wrenches.

T-Rex dataset overview với nhiều motor primitives và vật thể — nguồn: repo ZhuoyangLiu2005/T-Rex
T-Rex dataset overview với nhiều motor primitives và vật thể — nguồn: repo ZhuoyangLiu2005/T-Rex

Thiết kế dữ liệu không đi theo kiểu "thu thật nhiều demo cho một task dài". Nhóm tác giả tổ chức dữ liệu quanh object × motor primitive. Project page nêu 207 household objects, 22 motor primitives, sau khi loại các cặp không khả thi còn 502 combinations có ý nghĩa, mỗi combination khoảng 17 demonstrations. Đây là cách rất đáng học: thay vì ép robot học toàn bộ task "mở khóa, lấy thẻ, xếp bài" từ đầu, ta thu các kỹ năng tiếp xúc ngắn, có thể tái sử dụng như push, pinch, slide, rotate, insert, press, fold, wipe.

Trong LeRobot v3.0 path của repo, schema đáng chú ý gồm:

Feature Ý nghĩa
observation.images.head RGB head camera
observation.images.wrist_right RGB wrist camera phải
observation.images.wrist_left RGB wrist camera trái
observation.state[62] robot state đã gom theo EEF/joint representation
action[16,62] action chunk 16 bước, dạng delta-base
action_abs[62] action tuyệt đối
observation.tactile_f6[10,6] 10 fingertip × 6D wrench
observation.tactile_deform.{l,r}{0..4} deform video cho từng fingertip

Điểm quan trọng cho beginner: LeRobot v3.0 ở đây không chỉ là "folder video". Nó là format thống nhất để dataloader đọc được image streams, proprioception, action chunk và tactile sequence theo timestamp. Repo T-Rex còn ghi sidecar meta/trex_norm_stats.json để giữ q01/q99 normalization và tracking error tương thích với JSON pipeline.

Nếu bạn đã đọc LeRobot hands-on, hãy xem T-Rex như một ví dụ nâng cấp mạnh: không chỉ collect camera + action cho arm/gripper, mà đồng bộ cả tactile F6 và deform maps để policy có thể phản ứng trong contact phase.

Kiến trúc: hai clock trong một VLA

T-Rex dùng backbone Qwen3-VL-2B và triển khai dạng Mixture-of-Transformer-Experts. Thay vì một transformer khổng lồ xử lý tất cả token ở một tốc độ, model tách nhiệm vụ thành ba expert:

  • Latent expert: giữ priors từ visual-language reasoning và dự đoán latent/future visual representation để policy không mất ngữ cảnh task.
  • Action expert: tạo coarse action chunk từ vision, language, state và latent context. Đây là nhịp chậm, phù hợp với planning.
  • Tactile expert: nhận tactile mới và tinh chỉnh phần còn lại của action chunk bằng residual/refinement. Đây là nhịp nhanh, nhẹ hơn, không cần chạy lại toàn bộ vision stack.

Kiến trúc T-Rex MoT với latent, action và tactile expert — nguồn: project page T-Rex
Kiến trúc T-Rex MoT với latent, action và tactile expert — nguồn: project page T-Rex

Cơ chế inference cốt lõi là asynchronous cascaded flow matching. Có thể hiểu đơn giản như sau:

Đầu action chunk:
  camera + language + state -> slow pass
  action expert chạy một phần denoising
  cache KV và x_split

Trong chunk:
  tactile F6/deform mới -> fast pass
  tactile expert tiếp tục denoising từ x_split
  trả action đã refine

Điểm "cascaded" là action expert không cần hoàn tất toàn bộ flow một mình. Nó dừng ở một split step, lưu intermediate state. Sau đó tactile expert dùng tactile mới để chạy các bước còn lại. Vì tactile expert nhẹ và dùng cache từ slow pass, robot có thể phản ứng với contact thay đổi trong cùng chunk hành động. Đây là khác biệt lớn so với cách thêm tactile vào input rồi mỗi lần đều chạy full VLA.

Temporal tactile VQ-VAE

Tactile signal không chỉ là lực tại thời điểm hiện tại. Khi ngón tay trượt, pattern quan trọng nằm ở chuỗi: lực tăng, shear đổi dấu, deformation lan từ mép này sang mép kia. T-Rex vì vậy dùng một temporal tactile VQ-VAE trên rolling F6 window.

Theo README, mặc định model encode tactile codes on the fly từ raw F6 window qua embedded VQ-VAE. Trainers chạy với --use_tactile_vqvae 1, nên bạn không cần pre-bake tactile code vào JSON. Input có dạng lịch sử [B, window, 10, 6]: batch, window thời gian, 10 fingertip, mỗi fingertip 6 wrench channels. VQ-VAE dùng window 16 frame, codebook size 64, tạo discrete tactile tokens drift-robust. Nếu checkpoint midtrain đã embed VQ-VAE, train.py và test.py tự detect từ training_args.json.

Từ góc nhìn triển khai, đây là quyết định tốt. Bạn không muốn pipeline deploy phụ thuộc vào một service tactile encoder riêng biệt rồi phải debug version mismatch. Với checkpoint đã merge VQ-VAE, inference server chỉ cần nhận raw F6 history, model tự token hóa.

Cài đặt môi trường

Repo main của T-Rex tập trung vào post-training và inference. Pretraining/midtraining code nằm ở branch full-pipeline, còn pretrain/midtrain corpora đầy đủ không nằm trong release chính. Với người mới, bạn nên bắt đầu từ main branch và midtrain checkpoint.

Yêu cầu nền tảng hợp lý:

  • Linux workstation hoặc server GPU NVIDIA.
  • Python 3.10.
  • CUDA 12.4 nếu dùng đúng wheel torch trong README.
  • Disk đủ lớn cho dataset LeRobot/video.
  • Nếu train task riêng, cần dữ liệu raw gồm HDF5 + 3 MP4/head/wrist streams và tactile F6/deform tương thích.

Cài đặt tối thiểu:

conda create -n trex python=3.10 -y
conda activate trex

pip install torch==2.6.0 torchvision==0.21.0 \
  --index-url https://download.pytorch.org/whl/cu124

git clone https://github.com/ZhuoyangLiu2005/T-Rex.git
cd T-Rex
pip install -e .

Nếu bạn dùng LeRobot v3.0 data path:

git clone https://github.com/huggingface/lerobot.git
pip install -e /path/to/lerobot

Trong repo T-Rex, các script .sh có header để chỉnh PROJECT_ROOT, conda env path, data path và checkpoint path. Đừng chạy thẳng mà chưa mở file, vì default path chắc chắn không khớp máy của bạn.

Chuẩn bị dữ liệu task riêng

Bạn có hai đường dữ liệu:

JSON path là mặc định. Bạn để raw episodes dưới dạng:

<root>/success/episode_0001/
  episode.h5
  head.mp4
  wrist_left.mp4
  wrist_right.mp4

Sau đó chỉnh utils/gen_json_bimanual.sh hoặc gọi script Python:

python utils/gen_json_tac_deltabase_eef_bimanual_parallel.py \
  --data_roots /path/to/raw/task_a /path/to/raw/task_b \
  --img_save_root /path/to/training_data/images \
  --json_save_root /path/to/training_data/json \
  --task_name place_card_lr_bimanual_stride1 \
  --json_name_base place_card_deltabase_axis_eef_lr_bimanual_stride1_train \
  --instruction "Pick up the card and insert it into the slot" \
  --num_workers 16

LeRobot v3.0 path phù hợp nếu lab của bạn muốn chuẩn hóa với ecosystem Hugging Face. Chỉnh DATA_ROOTS, OUTPUT_ROOT, REPO_ID, LEROBOT_SRC trong utils/convert_inlab_to_lerobot.sh, rồi chạy:

bash utils/convert_inlab_to_lerobot.sh

Sau khi convert, chỉnh scripts/train.sh:

DATA_FORMAT="lerobot"
LEROBOT_ROOT="/data/lerobot/my_trex_task"

Với cả hai path, tactile codes không cần bake trước. Dataloader phát batch dict giống nhau, còn embedded VQ-VAE tự xử lý raw F6 history. Đây là chi tiết giúp bạn tránh lỗi phổ biến: train bằng một normalization path nhưng inference dùng path khác.

Training: từ midtrain checkpoint đến task riêng

Training recipe đầy đủ của paper có ba giai đoạn:

  1. Human egocentric pre-training: latent và action experts học từ 22.889 giờ video góc nhìn thứ nhất. Giai đoạn này không có tactile expert.
  2. Tactile-grounded robot mid-training: 100 giờ T-Rex dataset giúp model chuyển từ priors thị giác-ngôn ngữ sang contact dynamics trên robot thật, đồng thời train tactile expert.
  3. Skill-specific post-training: fine-tune trên khoảng 100 demonstrations cho task downstream.

Repo main cho bạn bắt đầu ở giai đoạn 3. Bảng model zoo release hai checkpoint: pretrain miniFranka/T-Rex_pretrain_mecka22k_epoch1 và midtrain miniFranka/T-Rex_midtrain_mecka23k_ucb100_vqvae_epoch6. Với task riêng, nên resume từ midtrain checkpoint.

Quy trình:

# 1. Tải hoặc mount checkpoint midtrain từ Hugging Face
# 2. Chỉnh scripts/train.sh
RESUME_CHECKPOINT="/path/to/T-Rex_midtrain_mecka23k_ucb100_vqvae_epoch6"
RESUME_SOURCE="midtrain"
DATA_FORMAT="lerobot"   # hoặc json
LEROBOT_ROOT="/data/lerobot/my_task"

# 3. Train
bash scripts/train.sh

Nếu train multi-node, README hỗ trợ MASTER_ADDR, MASTER_PORT, NUM_MACHINES, MACHINE_RANK. Effective batch size là train_bsz_per_gpu × NUM_PROCESSES × gradient_accumulation_steps. Với lab nhỏ chỉ có một máy, bạn nên giữ cấu hình single-node trước, đảm bảo dataset load đúng và loss giảm ổn định rồi mới scale.

Một checklist thực tế trước khi train:

  • Visual streams có đúng thứ tự head/right/left không.
  • Tactile F6 có đủ 10 fingertip, mỗi fingertip 6 channels không.
  • Action dimension có khớp 62 theo schema của T-Rex không.
  • Instruction có nhất quán với task không.
  • Normalize stats được tạo lại sau khi convert không.
  • Một batch từ dataloader có thể forward qua model không.

Nếu bạn chỉ có arm + gripper thường, không có dexterous hand/tactile tương thích, đừng kỳ vọng chạy T-Rex y nguyên. Khi đó bài học hữu ích hơn là kiến trúc slow/fast và format dataset, không phải checkpoint deploy trực tiếp.

Inference: slow/fast ZMQ protocol

Inference server nằm ở scripts/test.py, chạy qua scripts/test.sh. Server dùng một ZMQ REP socket và có ba mode:

Mode Khi nào dùng Việc xảy ra
slow đầu action chunk chạy partial action flow, cache KV và intermediate x_split
fast tick tactile giữa chunk nhận tactile mới, chạy phần flow còn lại qua tactile expert, trả action chunk refined
slow_and_fast tick đầu tiên chạy slow rồi fast liên tiếp

Chỉnh MODEL_PATH trong scripts/test.sh, sau đó:

bash scripts/test.sh

Robot-side client trong repo là hardware_code/eval/eval_trex_async.py. Client gửi request slow ở đầu chunk, rồi gửi fast ticks với tactile mới. Với checkpoint dùng embedded VQ-VAE, server tự giữ rolling 16-frame F6 buffer và encode tactile code nội bộ. Nếu bạn muốn ablation không tactile, dùng --disable_tactile 1 để thay slow tick bằng full action expert không có tactile expert.

Về mặt vận hành, điểm cần đo là latency end-to-end. Tactile expert có ích chỉ khi vòng fast thực sự nhanh hơn việc rerun full VLA. Bạn nên log timestamp cho camera frame, tactile packet, slow request, fast request và command gửi xuống controller. Nếu tactile packet đến trễ hoặc bị resample sai timestamp, policy có thể "phản ứng nhanh" với tín hiệu cũ.

Kết quả benchmark

Benchmark của T-Rex gồm 12 task contact-rich, chia vào các nhóm như force-sensitive contact, deformable-object manipulation và bimanual force-deformation coordination. Project page báo mỗi task được đánh giá trên 16 randomized trials. Kết quả macro-average:

Method Average success
T-Rex 65%
EgoScale 35%
π0.5 17%
Tactile-VLA 15%
RDP 6%
π0.5 + tactile 6%
ViTacFormer 3%

Thông điệp quan trọng không chỉ là T-Rex cao hơn baseline mạnh nhất hơn 30 điểm tuyệt đối. Điều thú vị hơn là π0.5 + tactile thấp hơn cả π0.5 thường. Điều này ủng hộ luận điểm của paper: tactile không thể chỉ được gắn thêm như một feature phụ. Nếu architecture và training recipe không phù hợp, tactile signal có thể làm pretrained VLA rối hơn.

T-Rex đạt kết quả mạnh ở các task như Flip Page 96%, Transfer Egg 75%, Wipe Plate 69%, Split Cup 78%, Acid-Base 76%, Extract Card 70%. Các task khó hơn như Screw Lightbulb vẫn còn thấp hơn, khoảng 35%, cho thấy tactile-reactive manipulation chưa "giải xong". Nhưng với bối cảnh dexterous bimanual real robot, khoảng cách so với baseline là rất lớn.

Failure cases của T-Rex trên các task contact-rich — nguồn: project page T-Rex
Failure cases của T-Rex trên các task contact-rich — nguồn: project page T-Rex

Ablation về training recipe cũng đáng chú ý. Paper cho thấy pretraining và mid-training đều quan trọng. Không có pretraining, model thiếu priors semantic/visuomotor. Không có tactile-grounded mid-training, model khó học contact dynamics chỉ từ khoảng 100 demo post-train. Full recipe đạt average 65% trên nhóm task ablation, trong khi biến thể yếu hơn giảm rõ rệt.

T-Rex khác gì các bài VLA xúc giác khác?

Nếu bạn đã đọc FM-VLA, FM-VLA dùng force history như memory token để giải quyết non-Markovian contact tasks. Nếu bạn đọc TORL-VLA, TORL-VLA kết hợp tactile sensing với online RL để refine policy khi deploy. T-Rex nằm ở một hướng khác: xây dựng một tactile-reactive foundation-style architecture có variable-rate experts và dataset mid-training lớn.

So sánh ngắn:

Hướng Mục tiêu chính Cách tactile đi vào policy
FM-VLA nhớ lịch sử lực cho task non-Markovian Force Memory Tokens
TORL-VLA thích nghi online khi contact shift Wrench-aware VLA + Online RL
T-Rex phản ứng tactile high-frequency trong dexterous manipulation MoT slow/fast experts + temporal VQ-VAE

Với người mới học VLA models, bài học lớn là: "multimodal" không chỉ là thêm nhiều input. Mỗi modality có tần số, noise profile và vai trò điều khiển khác nhau. Vision giỏi semantic grounding; tactile giỏi closed-loop correction; proprioception giữ trạng thái robot. Architecture tốt phải tôn trọng khác biệt đó.

Lộ trình thử nghiệm cho lab nhỏ

Nếu bạn muốn áp dụng ý tưởng T-Rex nhưng chưa có Vega-1 + Sharpa Wave, hãy đi theo lộ trình giảm rủi ro:

  1. Học LeRobot v3.0 trước: collect dataset camera + state + action trên robot đơn giản, đảm bảo replay và dataloader ổn.
  2. Thêm tactile nhỏ: bắt đầu với wrist force/torque hoặc fingertip sensor đơn giản, log đồng bộ timestamp.
  3. Định nghĩa motor primitives ngắn: thay vì task dài, collect nhiều clip ngắn như press, slide, insert, rotate.
  4. Kiểm tra latency: tactile chỉ hữu ích nếu fast loop không bị camera pipeline kéo chậm.
  5. Fine-tune từ checkpoint phù hợp: nếu embodiment quá khác T-Rex, đừng ép deploy trực tiếp; dùng repo như reference architecture.

Một lỗi phổ biến là đầu tư vào model trước khi data pipeline đủ sạch. Với tactile, lỗi timestamp 30-50 ms có thể làm policy học nhầm: lực xuất hiện sau hành động thay vì trước hành động. Hãy kiểm tra bằng plot: action command, joint response, tactile F6 và video frame phải khớp cùng event contact.

Kết luận

T-Rex là một bước tiến quan trọng vì nó đưa tactile feedback vào VLA theo cách đúng nhịp: vision-language planning chạy chậm hơn, tactile refinement chạy nhanh hơn, cả hai được nối bằng cascaded flow matching và temporal tactile VQ-VAE. Dataset 100 giờ, release khoảng 50 giờ theo LeRobot v3.0, giúp cộng đồng có một chuẩn tốt hơn cho dexterous contact-rich manipulation.

Với beginner, đừng đọc T-Rex như một repo "clone về là robot nào cũng chạy". Hãy đọc như một blueprint: collect primitives thay vì chỉ collect task dài; chuẩn hóa dữ liệu bằng LeRobot; dùng checkpoint midtrain khi embodiment phù hợp; tách inference thành slow/fast loop; và luôn đo latency/timestamp của tactile. Nếu làm đúng, tactile không chỉ là một cảm biến phụ. Nó trở thành reflex layer giúp VLA thao tác khéo léo hơn trong thế giới thật.

Bài viết liên quan

  • LeRobot hands-on: từ dataset đến policy
  • FM-VLA: Force Memory Token cho contact-rich manipulation
  • TORL-VLA: Fine-tune VLA với tactile và Online RL
NT

Nguyễn Anh Tuấn

Robotics & AI Engineer. Building VnRobo — sharing knowledge about robot learning, VLA models, and automation.

Khám phá VnRobo

Fleet MonitoringROS 2 IntegrationAMR Solutions

Bài viết liên quan

NEWTutorial
FM-VLA: Force Memory Token cho VLA Contact-Rich Manipulation
vlaforce-sensingmanipulation
wholebody-vla

FM-VLA: Force Memory Token cho VLA Contact-Rich Manipulation

FM-VLA dùng VAE nén lịch sử lực thành Force Memory Tokens, giúp VLA vượt giới hạn Markovian — đếm contact, nhớ tiến trình, đạt 83.3% trên robot AgiBot G1.

31/7/202614 phút đọc
NT
Tutorial
Pelican-VLA 0.5 trên LeRobot 3.0
pelican-vlalerobotvla
wholebody-vla

Pelican-VLA 0.5 trên LeRobot 3.0

Hướng dẫn chạy Pelican-VLA 0.5, hiểu Bottleneck Token, chuẩn bị LeRobot 3.0, training, inference và đọc kết quả RoboTwin.

29/7/202616 phút đọc
NT
Tutorial
Chạy LingBot-VLA 2.0 trên RoboTwin 2.0
lingbot-vla-2vlarobotwin-2
wholebody-vla

Chạy LingBot-VLA 2.0 trên RoboTwin 2.0

Hướng dẫn cài đặt, post-training và inference LingBot-VLA 2.0, VLA 55D đa hình thái cho RoboTwin 2.0.

17/7/202614 phút đọc
NT
VnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam