VnRoboVnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
VnRobo logoVnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam
VnRoboVnRobo
Về chúng tôiBảng giáBlogLiên hệ
🇺🇸ENĐăng nhậpDùng thử miễn phí
🇺🇸EN
  1. Trang chủ
  2. Blog
  3. VLA-ACL: huấn luyện chọn token ảnh trên LIBERO
wholebody-vlavlaopenvlavla-aclliberotoken-pruningaction-consistencypolicy-training

VLA-ACL: huấn luyện chọn token ảnh trên LIBERO

Cài VLA-ACL, huấn luyện patch scorer trên OpenVLA-OFT và đánh giá LIBERO: giảm token ảnh bằng Action Consistency Learning.

Nguyễn Anh Tuấn8 tháng 10, 202616 phút đọc
VLA-ACL: huấn luyện chọn token ảnh trên LIBERO

Một robot nhận lệnh “đặt chiếc bát vào ngăn kéo” không cần xử lý mọi vùng background với cùng chi phí như vùng gripper và chiếc bát. Nhưng nếu bỏ nhầm một patch chứa mép ngăn kéo, policy có thể dự đoán action sai dù vẫn nhận ra vật thể. VLA-ACL học cách lựa chọn visual token dựa trực tiếp vào hậu quả đối với action, thay vì mặc định vùng có attention lớn nhất luôn quan trọng nhất.

Bài hướng dẫn này dựa trên paper VLA-ACL: Action-Consistent Visual Token Pruning for Efficient Vision-Language-Action Models, Owen Du và cộng sự, công bố bản đầu ngày 6/10/2026, cùng repo chính thức du-owen/VLA-ACL. Mục tiêu là giúp bạn hiểu kiến trúc, chuẩn bị môi trường, chạy checkpoint đã phát hành, huấn luyện patch scorer và đánh giá kết quả trên LIBERO. Các số liệu bên dưới là kết quả tác giả báo cáo; bài viết không tuyên bố đã chạy training trên GPU của vnrobo.

Bạn không phải huấn luyện lại một VLA từ đầu. Recipe chính đặt một bộ chấm điểm patch nhỏ lên OpenVLA-OFT đã fine-tune, giữ nguyên vision encoder, language backbone, proprio projector và action head. Chỉ patch scorer nhận cập nhật gradient. Nếu còn lẫn lộn giữa nén representation và chọn token có sẵn, hãy đọc thêm Bottleneck Token trong Pelican-VLA.

Khuyến nghị công cụ

Stack train/deploy cho VLA

Train trên cloud/workstation, deploy bản tối ưu xuống Jetson hoặc robot computer.

Cloud GPU for VLA / policy training Dùng cho imitation learning, diffusion policy, RL và fine-tuning model robotics. Xem cloud GPU → NVIDIA Jetson Orin NX / Orin Nano Máy deploy edge cho perception, logging và inference đã tối ưu. Xem Jetson → Hugging Face / robotics dataset hosting Lưu dataset, checkpoint và model card để workflow LeRobot/VLA dễ chia sẻ hơn. Xem platform →

1. Chuẩn bị khái niệm trước khi chạy lệnh

Vision-Language-Action, viết tắt VLA, là policy nối ảnh camera, language instruction và trạng thái robot với action. Trong LIBERO, action có bảy thành phần: dịch chuyển theo ba trục, thay đổi orientation theo ba trục và lệnh gripper. Proprioception là thông tin robot biết về chính nó, chẳng hạn vị trí end-effector hoặc trạng thái gripper; đây không phải một ảnh camera khác.

Một visual token là vector biểu diễn một patch ảnh sau vision encoder. Vì camera thường sinh nhiều token, language backbone phải xử lý chuỗi dài ở mỗi lần policy được hỏi. Giảm số token đi vào backbone có thể giảm chi phí attention và các phép tính theo token. Tuy nhiên, vision encoder vẫn xử lý ảnh đầy đủ trước khi scorer chọn patch: pruning ở đây không đồng nghĩa giảm resolution hay bỏ luôn chi phí perception.

LIBERO là benchmark manipulation trong simulation, gồm các suite Spatial, Object, Goal và Long. Long cũng được gọi là LIBERO-10, tương ứng libero_10 trong evaluation và libero_10_no_noops trong dataset RLDS dùng ở tutorial. Hai tên khác nhau này là một nguồn lỗi phổ biến khi mới bắt đầu.

2. Ý tưởng paper: học token nào giữ được action

Giả sử bạn đã có policy tốt với đầy đủ ảnh. Hãy dùng chính policy đó làm teacher: đưa full visual context vào để lấy action tham chiếu. Sau đó đưa phiên bản bị soft-prune vào cùng policy, so sánh action dự đoán với teacher và action trong demonstration. Patch scorer được cập nhật để tìm ra những patch cần giữ nhằm làm hai dự đoán gần nhau.

VLA-ACL là Action Consistency Learning. Từ “consistency” ở đây nói về action output giữa full-context và pruned-context, không phải một bộ phân loại object hay một segmentation model. Dataset demonstration cung cấp ground-truth action; bạn không cần tự vẽ bounding box hoặc đánh dấu patch quan trọng.

Ví dụ, một patch nhỏ chứa điểm tiếp xúc giữa gripper và vật thể có thể ít nổi bật về semantics nhưng rất quan trọng cho điều khiển. Một mảng background lớn có thể thu hút attention mà không giúp action. Action-level supervision đặt tiêu chí cuối cùng đúng vào điều robot phải thực hiện. Đây là lý do học scorer có thể tốt hơn việc dùng attention score làm proxy cố định.

So sánh patch bị pruning hoặc caching trong một episode LIBERO-Spatial; vùng xám là patch bỏ hoặc tái dùng — nguồn: paper VLA-ACL, Figure 4
So sánh patch bị pruning hoặc caching trong một episode LIBERO-Spatial; vùng xám là patch bỏ hoặc tái dùng — nguồn: paper VLA-ACL, Figure 4

Hình trên so sánh lịch pruning/caching qua trajectory. VLA-ACL dùng ngân sách cố định ở từng lần query, kể cả query đầu tiên; không có temporal controller định kỳ đưa toàn bộ visual context trở lại. Điều này giúp hiểu lợi ích latency, nhưng cũng giải thích vì sao ngân sách quá nhỏ có thể ảnh hưởng nhiệm vụ dài.

3. Kiến trúc: scorer nhìn nhiều camera, ngân sách áp dụng từng camera

Trong thí nghiệm LIBERO, mỗi observation có hai camera view, mỗi view sinh 256 visual token. Tổng đầu vào ảnh là 512 token. Patch scorer là bidirectional Transformer năm layer, hidden dimension 1024 và 16 attention head; sau Transformer, một linear head xuất logit cho từng patch. Implementation patch_scorer.py cho thấy scorer nhận vision embeddings trước projection sang không gian LLM.

Scorer xử lý các view nối lại, cho phép các patch trao đổi thông tin giữa camera. Tuy nhiên, Top-K được áp dụng riêng cho mỗi view. Nếu K=64, hệ thống giữ 64 patch từ camera ngoài và 64 patch từ wrist camera, tổng 128 visual token. Đây không phải K=64 cho toàn bộ hai ảnh.

Cấu hình Token mỗi view Tổng token ảnh với hai view Tỷ lệ bỏ token ảnh
Full context 256 512 0%
K=64 64 128 75%
K=32 32 64 87,5%

Các con số này chỉ đếm visual token. Instruction, proprioception và action token vẫn có vai trò riêng trong chuỗi multimodal. Không nên lấy tỷ lệ bỏ token ảnh làm tỷ lệ giảm toàn bộ chi phí hệ thống.

Một chi tiết quan trọng là position index. Khi token bị xóa khỏi chuỗi, những token còn lại phải giữ vị trí RoPE tương ứng với chuỗi gốc. Repo chọn Top-K theo score rồi sắp index đã chọn về thứ tự gốc. Đừng tự ghép token theo thứ tự score hoặc đánh lại position liên tiếp mà bỏ qua logic này; bạn sẽ thay đổi cách backbone hiểu quan hệ vị trí.

text
Hai ảnh -> frozen vision encoder -> vision embeddings
                                    |
                             trainable patch scorer
                                    |
                           Top-K riêng từng camera
                                    |
Instruction + proprio -> frozen VLA backbone -> action chunk

4. Vì sao training dùng soft gate, inference dùng hard Top-K?

Hard Top-K quyết định giữ hoặc bỏ patch một cách rời rạc. Một thay đổi nhỏ trong logit thường không thay đổi tập token được chọn, nên gradient của phép lựa chọn bằng không ở gần như mọi nơi. Nếu dùng trực tiếp nó để train, action loss khó truyền tín hiệu hữu ích về scorer.

Paper giải quyết bằng soft Top-K. Mỗi patch có selection score s nằm trong khoảng 0 đến 1, với tổng score bằng K trên từng camera. Threshold thích nghi được tìm để đáp ứng ngân sách đó. Laplace cumulative distribution function biến khoảng cách giữa logit và threshold thành score; tham số alpha quyết định độ mềm.

Sau đó, embeddings được pha với embeddings của một ảnh đen đi qua cùng encoder và normalization:

text
X_soft[i] = s[i] * X[i] + sqrt(1 - s[i]^2) * black_embedding[i]

loss = 0.5 * mean_absolute_error(action_soft, action_teacher)
     + 0.5 * mean_absolute_error(action_soft, action_demo)

Đây là công thức giải thích thuật toán, không phải script training độc lập. Khi score gần 1, thông tin patch gốc được giữ; khi score gần 0, patch trở thành representation của ảnh đen. Training vẫn có đủ vị trí token, còn inference thực sự loại token khỏi backbone.

Soft pruning gate với patch scorer, soft Top-K và embeddings ảnh đen — nguồn: paper VLA-ACL, Figure 3
Soft pruning gate với patch scorer, soft Top-K và embeddings ảnh đen — nguồn: paper VLA-ACL, Figure 3

Vì sao không nhân embeddings với score rồi để những patch yếu thành zero vector? Paper có ablation cho thấy lựa chọn black-image embeddings thu hẹp khoảng cách soft-to-hard tốt hơn cách gating đó trong thiết lập nghiên cứu. Bản code cũng detach phần trọng số ảnh đen khi tính gradient vì đạo hàm của căn bậc hai trở nên rất lớn khi score tiến đến 1; gradient vẫn đi qua nhánh s * X.

Đặc biệt, “frozen backbone” không có nghĩa bọc mọi forward bằng torch.no_grad(). Teacher có thể chạy không gradient. Nhánh soft-pruned phải cho gradient đi xuyên qua backbone tới input embeddings, dù weights backbone không cập nhật. Repo dùng gradient checkpointing cho nhánh này để giảm bộ nhớ activation. Đây là điểm cần hiểu trước khi tối ưu training.

5. Cài đặt đúng fork của VLA-ACL

Chuẩn bị Linux, Conda, GPU NVIDIA có CUDA phù hợp và dung lượng trống cho model, dataset, cache. Tác giả dùng một A100; không có bằng chứng trong repo rằng recipe mặc định batch 8 phù hợp mọi GPU nhỏ. Một scorer nhẹ không làm biến mất weights của VLA 7B và activation phục vụ backward.

Các lệnh dưới đây dành cho máy training của bạn. Thực hiện trong terminal riêng, không trong thư mục blog:

bash
conda create -n vla-acl python=3.10 -y
conda activate vla-acl

git clone https://github.com/du-owen/VLA-ACL.git
cd VLA-ACL/src/openvla-oft

# CUDA 12.1 là ví dụ; chọn wheel tương thích driver của máy.
pip install torch==2.2.0 torchvision==0.17.0 torchaudio==2.2.0 \
  --index-url https://download.pytorch.org/whl/cu121
pip install -e .
pip install packaging ninja
pip install "flash-attn==2.5.5" --no-build-isolation

git clone https://github.com/Lifelong-Robot-Learning/LIBERO.git
pip install -e LIBERO
pip install -r experiments/robot/libero/libero_requirements.txt

SETUP.md kế thừa hướng dẫn OpenVLA-OFT nên còn nhắc clone repo upstream. Với tutorial này, cài editable package từ thư mục src/openvla-oft của VLA-ACL, vì fork này có scorer và modeling logic hỗ trợ pruning. pyproject.toml pin PyTorch 2.2.0 và dùng custom Transformers fork; đừng thay tùy tiện bằng Transformers mới nhất.

Kiểm tra trước khi tải dữ liệu lớn:

bash
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"
python -c "import transformers; print(transformers.__version__)"
python -c "from prismatic.models.patch_scorer import PatchScorer; print('scorer import OK')"

Nếu CUDA không khả dụng, xử lý driver và PyTorch trước. Nếu FlashAttention build lỗi, kiểm tra CUDA toolkit, compiler và phiên bản dependency theo SETUP. Đừng chuyển sang package ngẫu nhiên rồi coi kết quả benchmark vẫn so sánh trực tiếp được.

6. Tải policy, scorer và dữ liệu

Cách tải bằng Python giúp tránh phụ thuộc tên CLI Hugging Face thay đổi giữa các phiên bản. Từ thư mục src/openvla-oft, chạy:

bash
python - <<'PY'
from huggingface_hub import snapshot_download, hf_hub_download

snapshot_download(
    repo_id="moojink/openvla-7b-oft-finetuned-libero-10",
    local_dir="checkpoints/openvla-7b-oft-finetuned-libero-10",
)
hf_hub_download(
    repo_id="owendudu/VLA-ACL",
    filename="scorer-libero-10-k64.pt",
    local_dir="checkpoints/vla-acl",
)
PY

Scorer đã phát hành có file riêng cho Spatial, Object, Goal và 10, ở K=32 và K=64; mỗi state dictionary khoảng 130 MB. File scorer không phải một VLA đầy đủ. Bạn vẫn cần policy checkpoint, action head, proprio projector và dataset statistics đi kèm. Hãy tải snapshot đầy đủ thay vì chỉ chọn các file weights chính.

Chỉ evaluation thì không cần RLDS training dataset. Nếu muốn train scorer, tải thêm:

bash
python - <<'PY'
from huggingface_hub import snapshot_download
snapshot_download(
    repo_id="openvla/modified_libero_rlds",
    repo_type="dataset",
    local_dir="modified_libero_rlds",
)
PY

Dataset này khoảng 10 GB cho bốn suite theo LIBERO.md. Kiểm tra bên trong root có thư mục libero_10_no_noops; _no_noops nghĩa là các sample có action gần như không chuyển động đã được lọc. Không trỏ --data_root_dir vào chính thư mục con của suite rồi lặp lại tên suite qua argument.

7. Chạy baseline và checkpoint K=64 trước

Chạy một vòng nhỏ để phát hiện lỗi import, render và checkpoint. Với server headless, có thể dùng MUJOCO_GL=egl nếu GPU và EGL của máy hỗ trợ. Đây là tùy chọn cho môi trường, không phải cách sửa mọi lỗi graphics.

bash
python experiments/robot/libero/run_libero_eval.py \
  --pretrained_checkpoint checkpoints/openvla-7b-oft-finetuned-libero-10 \
  --task_suite_name libero_10 \
  --center_crop True \
  --num_trials_per_task 2 \
  --seed 67 \
  --patch_scorer.enabled False

Sau baseline, giữ nguyên suite, seed và preprocessing, rồi bật scorer:

bash
python experiments/robot/libero/run_libero_eval.py \
  --pretrained_checkpoint checkpoints/openvla-7b-oft-finetuned-libero-10 \
  --task_suite_name libero_10 \
  --center_crop True \
  --num_trials_per_task 2 \
  --seed 67 \
  --patch_scorer.enabled True \
  --patch_scorer.checkpoint checkpoints/vla-acl/scorer-libero-10-k64.pt \
  --patch_scorer.prune_topk 64

Dùng local checkpoint path là yêu cầu của README VLA-ACL. Loader đồng bộ modeling_prismatic.py, configuration và AutoMap với fork hiện tại. Nếu chỉ truyền model ID từ Hub ở evaluation, bạn có thể tải modeling code cũ không có tham số patch_scorer trong predict_action. Đây không phải lỗi scorer weights.

Hai episode mỗi task là smoke check, chưa đủ kết luận accuracy. Khi cả baseline và pruning chạy ổn, tăng lên 50 trials mỗi task và chạy ba seed riêng, giữ nguyên seed giữa các cặp so sánh. Paper dùng 1.500 episode cho mỗi suite: 10 task nhân 50 trials nhân ba seed. Ghi lại seed thực tế của bạn thay vì ngầm coi ví dụ 67 là toàn bộ protocol paper.

8. Huấn luyện patch scorer của chính bạn

Chạy lệnh dưới đây để dùng recipe mặc định của paper trên LIBERO-10:

bash
python vla-scripts/train_scorer.py \
  --vla_path checkpoints/openvla-7b-oft-finetuned-libero-10 \
  --data_root_dir modified_libero_rlds \
  --dataset_name libero_10_no_noops \
  --soft_top_k 64 \
  --batch_size 8 \
  --learning_rate 0.0001 \
  --max_steps 5000 \
  --teacher_weight 0.5 \
  --gt_weight 0.5 \
  --use_wandb False

--use_wandb False tránh việc mặc định script yêu cầu entity/project mẫu. Nếu cần dashboard, bật lại và cung cấp tài khoản của bạn. Theo train_scorer.py, optimizer là AdamW; learning rate có cosine decay, còn alpha giảm từ 2,0 xuống 0,1 qua 5.000 step.

Nếu hết VRAM, giảm batch size và ghi lại thay đổi. Có thể dùng --grad_accumulation_steps để điều chỉnh effective batch; điều này không biến một GPU thiếu bộ nhớ cho model thành đủ bộ nhớ. Đừng dùng số VRAM của fine-tuning upstream như bảo đảm cho scorer training, vì computation graph của hai quy trình khác nhau.

Checkpoint mặc định sẽ nằm ở:

text
runs/vla-acl+libero_10_no_noops+k64+teacher-0.5+gt-0.5+b8+lr-0.0001/
  patch_scorer_head--5000_checkpoint.pt

Run ID thay đổi nếu đổi batch, accumulation, learning rate hoặc thêm note. Để evaluate scorer vừa train, lấy đúng đường dẫn script in ra, thay giá trị --patch_scorer.checkpoint trong lệnh evaluation và giữ --patch_scorer.prune_topk 64. Với K=32, train hoặc tải file K=32 tương ứng rồi mới đổi argument.

Nếu dùng WandB, theo dõi action loss tổng, loss tới teacher, loss tới ground truth và hard Top-K metric. Soft training loss thấp nhưng hard Top-K loss cao báo hiệu surrogate chưa phản ánh tốt inference. Hãy kiểm tra alpha schedule, architecture và preprocessing trước khi kết luận phải train backbone. Với một ví dụ khác về cập nhật policy trên LIBERO, xem TGRPO và trajectory-level training.

9. Đọc kết quả: K=64 là điểm bắt đầu hợp lý

Table I của paper báo cáo các kết quả sau trên A100. Latency và TFLOPs đo LLM, không phải toàn bộ vòng camera → simulation → action execution.

Phương pháp Spatial Object Goal Long Trung bình TFLOPs Latency LLM
OpenVLA-OFT 97,8% 97,6% 97,6% 94,2% 96,8% 4,013 63,49 ms
VLA-ACL K=64 98,7% 98,4% 96,5% 94,2% 97,0% 1,412 46,82 ms
VLA-ACL K=32 98,2% 98,2% 96,6% 88,7% 95,4% 0,991 42,30 ms

Pareto frontier giữa success rate LIBERO-Long và TFLOPs của các phương pháp pruning — nguồn: paper VLA-ACL, Figure 1
Pareto frontier giữa success rate LIBERO-Long và TFLOPs của các phương pháp pruning — nguồn: paper VLA-ACL, Figure 1

Ở K=32, FLOPs giảm khoảng 75,3%, nhưng latency chỉ tăng tốc khoảng 63,49 / 42,30 = 1,50×. Điều đó minh họa FLOPs và latency không tỷ lệ tuyến tính. Ở K=64, tỷ lệ tăng tốc từ bảng là khoảng 1,36×, được paper làm tròn thành 1,4×.

Đánh đổi đáng chú ý nhất nằm ở Long: K=32 thấp hơn baseline 5,5 điểm phần trăm, trong khi K=64 giữ 94,2%. Do đó, với beginner, nên bắt đầu bằng K=64, xác minh từng task rồi mới thử K=32. Chênh lệch trung bình +0,2 điểm của K=64 không tự chứng minh một cải thiện có ý nghĩa thống kê trên mọi thiết lập.

Các baseline success rate trong paper được lấy từ publication tương ứng; không nên mô tả bảng này như mọi phương pháp đều được tác giả retrain và rerun toàn bộ. Khi đánh giá trên máy của bạn, đo cả policy latency lẫn end-to-end latency, cùng VRAM, số trial, failure mode và hardware. Action chunk gồm tám action trong thiết lập LIBERO; một lần forward không tương đương một bước điều khiển actuator.

10. Từ simulation sang robot thật và các giới hạn

Paper còn đánh giá bốn task trên AgileX PiPER-X kiểu ALOHA. Ở K=64, trung bình success là 72,5% so với 73,75% của OpenVLA-OFT; latency LLM giảm từ 91,5 xuống 62,1 ms. Các task dùng 50–100 expert demonstration để fine-tune base policy trước, nên đây không phải một scorer LIBERO chạy zero-shot trực tiếp trên hardware.

Phụ lục có kết quả với π0.5, nơi consistency được áp dụng lên flow-matching velocity ở cùng noise level. Latency 2,2× trong phần đó chỉ đo LLM pre-fill. Public tutorial và scorer checkpoint được mô tả trong README hiện tập trung OpenVLA-OFT; không giả định command train_scorer.py này huấn luyện π0.5, vì script chỉ hỗ trợ continuous L1 regression action head.

Trước khi triển khai, cần xác minh lại camera order, normalization và action contract của robot đích. Hướng dẫn PEFT và deployment VLA giúp đặt pruning vào pipeline lớn hơn. Một scorer giữ tốt action của teacher không thể tự sửa mọi lỗi vốn có của teacher hoặc bảo đảm robot phản ứng đúng với scene chưa từng gặp.

11. Bảng xử lý lỗi cho vòng thử đầu tiên

Hiện tượng Việc nên kiểm tra trước
Không import được patch scorer Editable install có trỏ vào fork VLA-ACL và đúng Conda environment không?
predict_action không hỗ trợ pruning Evaluation có dùng local policy snapshot để đồng bộ modeling code không?
Scorer báo shape mismatch Hidden dim 1024, năm layer, 16 head có khớp checkpoint không?
Thiếu dataset hoặc statistics key Dataset root, tên _no_noops và suite của policy có đồng nhất không?
Training dừng ở logging Đã tắt WandB hoặc điền entity/project đúng chưa?
Simulation không render MuJoCo backend, EGL và driver GPU có hoạt động trên máy không?
K=32 chạy nhanh nhưng task dài thất bại So sánh với K=64 trên cùng seed; kiểm tra mất visual context và rollout video

Một vòng thực hành đầy đủ gồm baseline smoke check, K=64 smoke check, training scorer nếu cần, evaluation nhiều trial và so sánh task-level failure. Lưu cùng kết quả tên policy, tên scorer, K, dependency versions và tham số preprocessing. Như vậy, khi accuracy giảm, bạn có thể xác định do pruning, mismatch checkpoint hay môi trường thay đổi, thay vì chỉ thấy một con số trung bình khó giải thích.

Bài viết liên quan

  • Pelican-VLA: hiểu Bottleneck Token và action pathway
  • TGRPO: fine-tune VLA trên LIBERO bằng trajectory-level RL
  • PEFT và triển khai VLA trong pipeline LeRobot
NT

Nguyễn Anh Tuấn

Robotics & AI Engineer. Building VnRobo — sharing knowledge about robot learning, VLA models, and automation.

Khám phá VnRobo

Fleet MonitoringROS 2 IntegrationAMR Solutions
← Bài trước
RACE-VLA: Action Chunk Dài Hơn 4x

Bài viết liên quan

Nghiên cứu
TGRPO: Fine-tune VLA với Trajectory GRPO và LLM Dense Reward
vlagrporeinforcement-learning
wholebody-vla

TGRPO: Fine-tune VLA với Trajectory GRPO và LLM Dense Reward

TGRPO kết hợp LLM dense reward với dual-level advantage (step + trajectory) fine-tune OpenVLA-7B trên LIBERO, đạt 91% success rate — vượt SFT 4.6%, PPO 4.4%.

1/7/202611 phút đọc
NT
Nghiên cứu
μVLA: Memory Token Tăng Tỉ Lệ Thành Công Từ 42% lên 84%
vlarecurrent-memoryopenvla
wholebody-vla

μVLA: Memory Token Tăng Tỉ Lệ Thành Công Từ 42% lên 84%

μVLA thêm learnable recurrent memory token vào OpenVLA-OFT để giải quyết partial observability, tăng success rate từ 42% lên 84% trên MIKASA-Robo.

25/8/202611 phút đọc
NT
Tutorial
SLIM-0.5B: VLA gọn nhẹ trên LIBERO
slim-0.5bvlalibero
wholebody-vla

SLIM-0.5B: VLA gọn nhẹ trên LIBERO

Hướng dẫn SLIM-0.5B, mô hình VLA manipulation gọn nhẹ với action-grounded predictive latents trên LIBERO.

14/8/202616 phút đọc
NT
VnRobo logoVnRobo logo

Hạ tầng AI cho robot công nghiệp thế hệ mới.

Sản phẩm

  • Tính năng
  • Bảng giá
  • Kiến thức
  • Dịch vụ

Công ty

  • Về chúng tôi
  • Blog
  • Liên hệ

Pháp lý

  • Chính sách bảo mật
  • Điều khoản sử dụng

© 2026 VnRobo. Bảo lưu mọi quyền.

Được tạo với♥tại Việt Nam