论文

被编码却未被控制:视觉语言机器人策略中的定位落差

Encoded but Not in Control: Revealing the Grounding Gap in Vision-Language Robot Policies

模型评测模型行为与机制分析

摘要

指令遵循是语言条件机器人策略的核心:当同一场景允许多个有效动作时,语言应该确定要做什么。然而,仅成功执行并不能确定策略是否遵循指令或从场景推断任务。我们通过场景保留指令干预来研究这种歧义,在保持场景固定的情况下使用有效的目标替换、任意名词和不相关的句子。我们在模拟和现实实验中评估视觉-语言-动作 (VLA) 策略和世界动作模型 (WAM)。我们的分析解决了三个问题:(a) 任务成功率是否意味着遵循指令?当指令请求不同的可见对象时,所有评估的策略主要接近并拾取与场景关联的不正确的原始目标。 (b) 此失败是否是由于语言不敏感造成的?指令扰动会影响任务性能。逐层动作透镜显示了对这些扰动做出响应的中间动作预测。线性探针准确地恢复指令目标,表明尽管很少确定目标选择,但修改后的指令仍被编码。 (c) 为什么编码语言无法控制动作?注意力分析表明指令token对动作生成的贡献较弱。 Target-token注意力可以保持集中在原始对象上,揭示目标编码和视觉定位之间的不匹配。 UMAP 和共享非负矩阵分解表明,目标信息在越来越多地按场景身份组织的表示中仍然可以访问。我们的研究结果揭示了名义上的成功所掩盖的定位落差,并提供了一个诊断框架。他们进一步建立了具体的进展标准:策略应该可靠地遵循用户意图的有效变化,即使它们与场景偏好的行为发生冲突。

被编码却未被控制:视觉语言机器人策略中的定位落差的原论文方法或结果图
图 1:目标替换揭示了指令跟随方面的差距。保持场景固定,我们更改指令以请求另一个可见且可到达的对象。在 LIBERO-Object 和现实世界操作中,策略很少掌握当前指令的目标(绿色虚线轨迹),而主要掌握原始指令指定的目标(红色实线轨迹)。