论文

光看到还不够:视觉语言模型感知证据但未能采取行动

Seeing is not Enough: Vision-Language Models Perceive Evidence but Fail to Act

模型推理推理策略与问题分解

摘要

视觉语言模型 (VLM) 在视觉问答基准上表现强劲,但经常做出与它们已经正确识别的视觉证据相矛盾的决策。我们将感知失败(相关证据未得到认可)与流程失败(认可的证据无法限制最终决策)区分开来。我们引入了 VPAC-Bench,这是一个涵盖九个真实图像处理系列的基准,每个图像都由其当前活动阶段和附近的阶段转换进行注释。我们还提出了状态相关性目标(SRT),这是一系列结构化的流程优先干预措施,需要模型在回答之前将可见证据与相关流程状态联系起来。在多个 VLM 中,流程失败很普遍:正确枚举视觉候选的模型在超过 95% 的模糊情况下仍然过度承诺单一答案。明确的流程结构干预可将该比率降低至 13% 以下,而不会降低明确案例的性能。然而,流程先验的转移取决于模型,并且通用 SRT 并不总是优于强大的思想链基线。当相关阶段转换已知时,边界对齐 SRT 的性能显着优于通用流程提示以及跨装配、物理状态转换、导航和交通以及对象使用可供性任务的所有测试的思想链基线。这些结果表明,当与场景的特定决策边界对齐时,流程先验最有用,从而激发基于流程的视觉推理的边界感知先验选择。