论文

超越捷径:通过定性推理减轻冻结 VLM 中的视觉错觉

Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning

模型推理推理验证与自校正

摘要

虽然视觉语言模型(VLM)在一般视觉任务中取得了最先进的性能,但在面对视错觉时,它们的感知鲁棒性仍然非常脆弱。这些失败通常归因于捷径启发法,其中模型优先考虑语言先验和记忆原型而不是直接视觉证据。在这项工作中,我们提出了结构化定性推理(SQI),这是一种以数据为中心的 无需训练 框架,旨在增强冻结 VLM 中的视觉基础。 SQI 通过三个系统模块解决感知异常:(1)公理约束注入,抑制错误的度量估计和定量幻觉; (2)分层场景分解,将目标视觉流形与复杂的背景干扰物解耦; (3) 反事实自我验证,一种减少确认偏差的对抗性推理步骤。通过在推理时协调这些定性约束,SQI 有效地将高级语言推理与低级视觉感知结合起来。我们的框架在 DataCV 2026 挑战赛(任务 I:经典错觉理解)上进行了评估,总体排名第二。实验结果表明,SQI 不仅显着提高了不同错觉类别的准确性,而且无需任何模型 微调 即可提供卓越的诊断可解释性。我们的成功强调了结构化定性基础作为开发下一代抗幻觉视觉语言系统的强大范例的潜力。