论文
RoboFollow:揭示具体代理中 Mirage 后的指令
RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents
摘要
现代实体代理取得了令人印象深刻的成功率,但他们实际的指令遵循能力远弱于这些数字所显示的能力。我们将这种错觉追溯到一种我们称之为低场景熵的结构属性:当视觉场景只允许一个有效任务时,语言变得多余,并且策略在几乎不使用它的情况下可以获得高分。我们引入了 RoboFollow,一种具有三个原则的诊断基准:(1)高场景熵:每个训练场景支持多个运动学上不同的任务分支,使得仅视觉不足并被迫依赖语言。 (2) 分层诊断协议:四级协议 (L0--L3) 逐渐扰乱视觉布局和语义,探索等效指令是否产生一致的行为,不同的指令是否产生跨空间关系、属性、轨迹约束和逻辑的可区分行为。 (3) 混杂控制诊断:我们简化交互对象,将动作限制在训练有素的范围内,并报告阶段性意图和执行分数,将理解与运动执行分开。对九个 VLA 和 WAM 策略的评估表明,在我们的微调设置下,即使获得了强大的 L0 性能,也不会可靠地转移到 L1--L3。代表性的缓解措施,包括更强的 VLM 主干、QA 协同训练、LangForce 和无分类器指导,都未能缩小这一差距。 RoboFollow 将真正的指令跟随暴露为一个关键的、被忽视的瓶颈。代码和数据集可从此 https URL 和此 https URL 获取。