论文
通过逆动态学习减轻视觉-语言-动作模型中的状态混叠
Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning
摘要
视觉-语言-动作 (VLA) 模型已成为一种很有前途的框架,它通过将预训练的视觉-语言模型 (VLM) 应用于动作预测来统一机器人操作的感知、推理和控制。然而,VLM 派生的表示通常对低级控制所需的细微视觉差异不敏感,导致视觉上相似的状态之间出现状态混叠,而这些状态需要实质上不同的操作。先前的 VLA 研究通过生成视觉或推理输出(例如未来帧、2D 定位点或轨迹或中间空间推理步骤)来提高视觉理解,但这些目标通常仅通过端到端预测间接塑造视觉编码器,并且不会显式分析学习的视觉特征空间中的状态混叠。为了减轻状态混叠,我们引入逆动态学习作为直接监督 VLA 视觉编码器的辅助目标。通过预测当前和未来观察之间的动作,我们的目标鼓励编码器捕获确定低级动作的细粒度视觉区别。我们进一步使用伪反向监督将编码器暴露于更广泛的动作方向,并在有限的机器人演示下提高泛化能力。我们的方法适用于不同的 VLA 基线,仅使用标准观察-动作对,无需额外注释,并在测试时保留原始推理管道。 CALVIN ABC-D 和 SimplerEnv 上的实验表明,在不同的 VLA 基线上都有一致的增益。冻结编码器探测和状态特征对齐分析进一步表明,我们的方法学习了状态区分视觉表示,可以减少状态混叠并更好地与机器人状态变化对齐。