论文

FailBench:VLM 在判断机器人任务成功方面有多可靠?

FailBench: How Reliable are VLMs at Judging Robot Task Success?

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地用于评估机器人操作结果,但现有基准提供的跨领域泛化证据有限。我们引入了 FailBench,这是一个机器人故障检测基准,包含 14 个公共来源(12 个真实世界,2 个模拟)的 2,197 次操作尝试。在 FailBench 中,75% 的故障是自然发生的,六个真实来源来自非故障检测数据集。通过评估 13 个基于 VLM 的检测器,我们发现最好的模型仅达到 0.77 的平均平衡精度。值得注意的是,针对故障检测进行微调的模型始终表现不佳通用 VLM 及其自己的预训练基线。性能在很大程度上取决于所需的视觉证据:当结果取决于可观察的物体运动时,模型接近饱和,但在接触密集型装配任务中,模型会降级为近乎偶然(<0.60 平衡精度)。错误分析揭示了在模棱两可的证据下预测成功的系统性偏差,即使增加推理努力,这种偏差仍然存在。最后,我们表明,输入级干预(空间定位和裁剪与结果相关的区域)无需额外训练即可将顶部检测器提高 2.4 个百分点。