论文
ConflictVLA-Bench:区分机器人任务失败与行为停止
ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts
摘要
视觉语言动作(VLA)模型在操作任务上表现较强,但其面对无效任务前提时的响应仍缺乏研究。现有前提冲突评测往往侧重最终任务结果,而任务失败本身无法区分行为脱离与继续追求目标后出现的执行错误。我们将后一种模式称为Failed Persistence,即失败中的持续执行。为研究这一现象,我们提出ConflictVLA-Bench,将冲突执行轨迹与前提一致的参考轨迹配对,同时评估结果和执行过程。该基准基于LIBERO,包含2826个由提示条件化的冲突任务,覆盖四类冲突、四种结构配置和两种提示条件。在全部八种VLA中,无效前提使原始目标完成率至少降低17.3个百分点,OpenVLA的降幅达到56.2个百分点。关键在于,即使模型在前提一致任务中成功、在配对冲突任务中失败,也经常继续接近原目标、保留早期轨迹结构,而且动作幅度抑制有限。因此,Failed Persistence在受测模型中反复出现。显式前提检查未能稳定产生选择性、协调一致的行为变化。这些发现说明,最终失败既不能证明行为已脱离,也不能证明模型已拒绝执行;仅看结果不足以评估VLA。实验数据和更多细节见项目页面。 https://github.com/EmbodiedAISurvey/ConflictVLA-Bench