论文

别眨眼:多模态推理过程中的证据坍缩

Don't Blink: Evidence Collapse during Multimodal Reasoning

模型评测模型行为与机制分析

摘要

推理型视觉语言模型(VLM)在思考过程中可能变得越来越准确,同时逐渐丧失视觉锚定。这造成了任务条件化的危险区:低熵的预测看似自信却缺乏视觉依据,这一失败模式是纯文本监控无法察觉的。在MathVista、HallusionBench和MMMU_Pro上评估三个推理VLM后,我们发现一种普遍存在的证据坍缩现象:随着推理展开,对标注证据区域的注意力大幅下降,往往丢失超过一半的证据质量(evidence mass)。在跨数据集迁移下,完整响应的熵是最可靠的纯文本不确定性信号,但用单一全局线性规则加入视觉特征则十分脆弱,且常常降低迁移效果。一个熵-视觉交互模型揭示了一种任务条件化的规律:低熵且视觉脱联的预测在持续视觉引用任务上有害,而在符号类任务上无害。利用这一结构,一种有针对性的视觉否决机制在90%覆盖率下将选择性风险最多降低1.9个百分点,同时在预期会出现视觉脱联之处避免性能退化。这些结果支持在分布偏移下安全部署时采用任务感知的多模态监控。

别眨眼:多模态推理过程中的证据坍缩:论文配图
图 1:证据崩溃会产生纯文本监控无法看到的置信错误。 GLM-4.6V-Flash 在几乎相同的地图比较问题上处理了两个 HallusionBench 示例。顶部(失败):在对抗性修改的地图上,模型尽早尝试视觉基础,但文本先验覆盖了中间推理的图像证据(红色跨度),产生了一个自信的错误答案,而没有注意力恢复。底部(成功):在未修改的地图上,文本先验与图像一致,视觉参与度持续,在中期达到顶峰。熵导出的置信度仅相差 3 个百分点(87.2% 与 90.2%),但 Vthinking​_​aucV_{\mathrm{thinking\_auc}} 总结的视觉注意力轨迹却有质的不同。纯文本置信度无法区分这些情况;累积视觉注意力可以。