论文
被编码却未被控制:视觉语言机器人策略中的定位落差
Encoded but Not in Control: Revealing the Grounding Gap in Vision-Language Robot Policies
摘要
指令遵循是语言条件机器人策略的核心:当同一场景允许多个有效动作时,语言应该确定要做什么。然而,仅成功执行并不能确定策略是否遵循指令或从场景推断任务。我们通过场景保留指令干预来研究这种歧义,在保持场景固定的情况下使用有效的目标替换、任意名词和不相关的句子。我们在模拟和现实实验中评估视觉-语言-动作 (VLA) 策略和世界动作模型 (WAM)。我们的分析解决了三个问题:(a) 任务成功率是否意味着遵循指令?当指令请求不同的可见对象时,所有评估的策略主要接近并拾取与场景关联的不正确的原始目标。 (b) 此失败是否是由于语言不敏感造成的?指令扰动会影响任务性能。逐层动作透镜显示了对这些扰动做出响应的中间动作预测。线性探针准确地恢复指令目标,表明尽管很少确定目标选择,但修改后的指令仍被编码。 (c) 为什么编码语言无法控制动作?注意力分析表明指令token对动作生成的贡献较弱。 Target-token注意力可以保持集中在原始对象上,揭示目标编码和视觉定位之间的不匹配。 UMAP 和共享非负矩阵分解表明,目标信息在越来越多地按场景身份组织的表示中仍然可以访问。我们的研究结果揭示了名义上的成功所掩盖的定位落差,并提供了一个诊断框架。他们进一步建立了具体的进展标准:策略应该可靠地遵循用户意图的有效变化,即使它们与场景偏好的行为发生冲突。
