论文

推理视觉语言模型对语义视觉干扰是否稳健?

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

模型评测基准与评测资源

摘要

推理视觉语言模型 (VLM) 在复杂的多模式任务上实现了强大的性能,但可靠的现实世界应用程序需要处理比干净、策划的基准更混乱的视觉输入。现有的工作主要通过输入损坏来评估 VLM 的可靠性,例如噪声、模糊和天气影响,这些使得视觉证据更难感知。这使得关键的可靠性故障模式尚未得到充分探索:模型可能会正确感知证据,但会从看似合理但不相关且分散注意力的证据中进行推理,并将此错误传播到最终答案。为了解决这一差距,我们引入了 \textbf{Distract-Bench},这是一个评估 VLM 对 \textbf{语义视觉干扰} 稳健性的基准,定义为添加到输入中的有意义但与任务无关的视觉提示,同时保留 真值 答案。我们针对传统视觉损坏和 Distract-Bench 全面评估了八个领先的开源 VLM 和两个闭源 VLM。我们的结果表明,Distract-Bench 暴露了与视觉损坏不同的鲁棒性失败:推理 VLM 在感知退化下很大程度上跟踪其非推理基础模型,但对语义干扰的鲁棒性始终较低。进一步分析表明,这些干扰往往会进入VLM的推理过程,被视为证据,并导致错误的答案。总之,这些发现重新构建了推理 VLM 的鲁棒性评估,将焦点从感知退化转移到可靠的现实世界视觉推理的干扰上。我们的数据和代码可在 https://github.com/Yizheng-Sun/Distract-Bench 获取。