论文

重新计算还是重用?诊断和缓解 VLM 自我反思中的文本快捷方式

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

模型推理推理验证与自校正

摘要

当视觉证据发生变化时,视觉语言模型(VLM)预计会修改其推理。未能做到这一点通常归因于视觉注意力不足或上下文惰性,从而不清楚重用哪些模型而不是从当前图像重新计算。我们证明,先前的思维链(CoT)中的证据推理可以形成一种文本捷径,在行为上与视觉重新计算竞争。在 16 个 VLM 中,匹配的反事实分析将有证据的内容确定为先前 CoT 影响力的最强大载体。删除这些有证据的内容比删除长度匹配的非证据上下文或最终答案范围更能改变答案偏好,随着更多过时的证据被删除,先前的控制逐渐减弱。重新排序这些证据也削弱了先前的控制,表明其组织调节了捷径强度。除了立即答案之外,快捷方式还可以在答案修正后保留残余影响:削弱当前图像支持会将偏好转移回先前的答案,而重复的先前答案和重复使用的前提主要在快捷方式保持活动状态时出现。为了限制这种影响,我们引入了 Fresh-State Attention Firewall (FSAF),这是一种 无需训练 干预措施,可将新计算与先前的 CoT 隔离开来。在五个 VLM 中,FSAF 将视觉更新率从 35.28% 提高到 53.61%,并将先前答案率从 39.22% 降低到 3.67%。因此,可靠的 VLM 自我反思需要的不仅仅是再次查看:必须保护新的视觉重新计算免受过时的文本重用。