论文
别眨眼:多模态推理过程中的证据坍缩
Don't Blink: Evidence Collapse during Multimodal Reasoning
摘要
推理型视觉语言模型(VLM)在思考过程中可能变得越来越准确,同时逐渐丧失视觉锚定。这造成了任务条件化的危险区:低熵的预测看似自信却缺乏视觉依据,这一失败模式是纯文本监控无法察觉的。在MathVista、HallusionBench和MMMU_Pro上评估三个推理VLM后,我们发现一种普遍存在的证据坍缩现象:随着推理展开,对标注证据区域的注意力大幅下降,往往丢失超过一半的证据质量(evidence mass)。在跨数据集迁移下,完整响应的熵是最可靠的纯文本不确定性信号,但用单一全局线性规则加入视觉特征则十分脆弱,且常常降低迁移效果。一个熵-视觉交互模型揭示了一种任务条件化的规律:低熵且视觉脱联的预测在持续视觉引用任务上有害,而在符号类任务上无害。利用这一结构,一种有针对性的视觉否决机制在90%覆盖率下将选择性风险最多降低1.9个百分点,同时在预期会出现视觉脱联之处避免性能退化。这些结果支持在分布偏移下安全部署时采用任务感知的多模态监控。
