论文
纠正 WHERE,保留 HOW:通过参考指导对视觉-语言-动作模型进行组合概括
Correcting WHERE, Preserving HOW: Compositional Generalization for Vision-Language-Action Models via Referential Guidance
摘要
虽然视觉-语言-动作(VLA)模型能够生成灵活的动作,但它们在不同环境元素(包括操纵对象、目的地和背景)中的泛化受到机器人训练数据缺乏多样性的限制。 VLA 在此类数据上进行端到端训练,倾向于利用视觉捷径,将动作与任务无关的视觉特征而不是预期的任务语义相关联。这些捷径阻止了策略已经看到的元素的重组,即组合泛化。现有方法通过与任务相关的感知或有针对性的数据多样化来减轻这种纠缠,但没有为看不见的重组提供明确的机制,并且需要通过再训练进行特定于主干的修改。我们观察到,在这种重组下,VLA 经常在全局grounding方面失败,同时保留局部操纵技能,在熟悉的配置中恢复到正确目标附近。因此,我们提出了参考指导(ReGuide),这是一种免训练的包装器,根据来自grounding模块的给定对象姿势,结合语义和几何重新绑定来引导末端执行器进入受指示参考对象的演示支持配置,其中冻结的策略可以恢复执行。跨多个 VLA 主干以及真实机器人的模拟实验表明,ReGuide 将组合变化下的成功率分别提高了 56.8 和 75.0 个百分点,同时保持了标准任务性能。