论文

学习跨实体机器人操作的动作先验

Learning Action Priors for Cross-embodiment Robot Manipulation

模型训练预训练

摘要

大多数视觉-语言-动作 (VLA) 模型都建立在视觉-语言模型 (VLM) 主干之上,通过附加动作模块并联合优化整个策略。该设计继承了 VLM 强大的视觉和语言先验,但让动作模块几乎从头开始学习物理运动。因此,该策略缺乏明确的运动先验,迫使早期优化同时发现时间动作动态和跨模式对齐,这一挑战在跨实施例设置中进一步放大。在这项工作中,我们建议在跨模态 VLA 对齐之前使用运动先验对动作模块进行预训练。具体来说,我们引入了一个两阶段训练框架,在 VLA 训练开始之前为动作模块配备跨实施例时间运动结构。在 Stage~1 中,基于流匹配的轻量级编码器-解码器动作模块仅从无条件动作轨迹中有效地学习时间运动结构,而不处理视觉或语言标记。在阶段〜2中,通过解码器重用和早期潜在蒸馏将学到的先验转移到VLA训练,将视觉语言特征与动作嵌入空间对齐,同时仍然允许端到端策略细化。此外,经过训练的编码器充当紧凑的历史压缩器,将状态动作历史汇总为单个时间上下文标记,以可忽略的成本进行历史感知建模。在模拟和现实世界平台上进行的 13 个不同的跨实施例任务的广泛实验验证了我们方法的有效性。与没有先验动作的 VLA 训练相比,我们的模型在数据稀缺的现实任务中实现了更快的收敛、更高的成功率和更强的性能。此外,扩大 Stage~1 中的动作数据会产生更通用的先验动作,从而直接提高下游 VLA 性能。