论文
通过明确的语言-动作对齐奠定分层视觉-语言-动作模型的基础
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
摘要
实现机器人透明度是实现有效人机协作的关键一步。为了做到透明,机器人的自然语言交流必须与其行为一致,并且明确地基于任务和环境。现有的分层视觉-语言-动作(VLA)模型可以生成语言(例如,通过思维链)和底层动作。然而,当前的工作并未考虑训练期间这些模式之间的明确一致性。为了解决这一关键差距,我们提出了一种新颖的训练框架,该框架明确基于视觉观察和动作空间的分层 VLA 子任务描述。我们的框架使用对比模型来评估生成的语言和相应的动作轨迹之间的一致性。这种对比模型可以根据不同的语言轨迹对的对齐情况进行直接排序,从而使我们能够通过离线偏好学习来完善分层 VLA 的基础。我们将我们的框架应用于 LanguageTable 数据集(人类语言注释轨迹的基准数据集),并提供对多模态基础表示的重要见解,同时建立一个强大的基线,实现与完全监督的 微调 相当的性能,并最大限度地减少对昂贵数据注释的需求。