论文

通过 VLA 后训练实现高自由度灵巧操作

Towards High-DoF Dexterous Manipulation through VLA Post-Training

模型训练监督微调与指令调优

摘要

模仿学习的视觉-语言-动作(VLA)基础模型通过跨任务和实施例扩展机器人数据来获得广泛的操作能力,但在特定下游任务和硬件平台上的可靠部署仍然需要后期训练。灵巧的双手使这种适应变得特别困难:它们广泛的行为能力和高度的自由度创造了一个大的、结构化的行动空间。三个障碍是核心:开源 VLA 本身并不为高自由度手提供动作界面;人为门控 DAgger 接管期间的手势不匹配会造成命令不连续性并污染纠正轨迹;原始关节空间中的强化学习样本效率低下。我们提出了一个统一的四步后训练流程,包括学习的时间手动作编解码器、监督微调、DAgger 和现实世界的残差强化学习。编解码器使预训练的 VLA 适应绝对灵巧的手命令。缓冲回滚、姿势对齐和平滑命令混合可实现连续的、与任务相关的 DAgger 校正,而潜在残差 RL 将探索限制在编解码器捕获的协调手部动作。我们评估了五种不同的现实世界任务的流程,包括双手转移、手动重新定向和工具使用。在报告的后训练预算内,最终的策略在每个任务超过 20 次试验的每个评估任务上都取得了 100% 的成功。这些结果为使 VLA 基础模型适应现实世界中可靠的灵巧操作提供了一条实用途径。