唯唯诺诺综合症:对实体机器人代理的弃权进行基准测试
The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents
摘要
视觉语言模型(VLM)用作实体代理的高级规划器,将自然语言指令和视觉观察转化为行动计划。虽然之前的工作已经研究了 LLM 中的弃权,但现有的基准测试主要是纯文本的,并且没有捕获具体机器人环境固有的感知基础和物理约束。在这种情况下,弃权需要识别指令何时含糊不清,物理上不可行,基于错误的前提,或者在给定可用的感官模式和上下文的情况下无法解决。为了解决这一差距,我们引入了一种分类法,对嵌入式机器人背景下的弃权进行分类,并提出了 RoboAbstention,这是一个可扩展且可审计的框架,用于生成基于从五个机器人数据集收集的图像的弃权指令。 RoboAbstention 通过三阶段管道实例化分类法:(1) 结构化视觉基础,(2) 确定性约束推导,以及 (3) 通过特定于类别的模板控制指令生成。这使得能够构建具有可验证的弃权条件的多样化数据集。我们评估了几个前沿 VLM,发现所有模型在弃权方面都表现出明显的弱点,包括那些具有高级推理能力的模型。性能最好的模型 Gemini 2.5 Flash 仅放弃了 6,069 条基准指令中的 39.0%,而具体规划器 Gemini Robotics ER 1.6 Preview 仅放弃了 16.5%。我们进一步探索了提高 VLM 规划者弃权率的方法,例如防御性提示和情境学习,发现这些干预措施可以显着提高绩效,Gemini Robotics ER 1.6 Preview 的弃权率达到 93.6%,GPT 5.4 Mini 的弃权率达到 88.6%,但还没有方法完全解决问题。我们在 https://purseclab.github.io/RoboAbstention/ 开源了 RoboAbstention。