问题关键证据逐渐丢失下选择性视觉推理的证据顺序校准
Evidence-Order Calibration for Selective Visual Reasoning under Progressive Loss of Question-Critical Evidence
摘要
当视觉证据退化时,视觉语言模型 (VLM) 置信度可能会发生总体变化,同时在各个示例中保持结构不一致。 We study answer-level reliability along five-step, question-conditioned evidence-loss trajectories.使用冻结的 Qwen2.5-VL-3B-Instruct 模型,我们通过逐步屏蔽场景图本地化的问题关键区域,构建了 176 个接受的 GQA 派生轨迹(880 个屏蔽条件)。本机序列置信度的证据单调性违规率为 0.436,并且 92.0% 的轨迹包含至少一个相邻违规。匹配的非关键区域控制表明,完全关键遮蔽将准确度降低了 28.2 个百分点,而同等大小的非关键遮蔽则降低了 0.6 个百分点; the paired difference is 27.6 points (95% CI [20.0, 34.7]). We train a lightweight post-hoc reliability head on frozen hidden states, sequence confidence, and entropy.在二元交叉熵 (BCE) 中添加证据顺序监督可将掩蔽 EMVR 从 0.330 降低至 0.303(配对差值 -0.027,95% CI [-0.044,-0.010])。在未见的局部高斯模糊下,相同的掩模训练目标将保留问题 ID 的 EMVR 从 0.449 降低到 0.402(差异 -0.0468,95% CI [-0.0739,-0.0199])。两个学习者之间的 AUROC、Brier 和 AURC 差异在统计上没有结论,并且对于选择性风险排名的本机信心仍然更强。结果将证据顺序一致性与传统的正确性歧视区分开来,而不是建立通用置信优势。