当思考受伤时:视觉语言模型推理链中的认知信号
When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models
摘要
视觉语言模型(VLM)的不确定性量化通常以答案标记分布为目标。我们提供了思维模式 VLM 中答案熵行为的第一个三族经验表征。在相同的 POPE 对抗样本上运行四个模型,我们发现了三种性质不同的模式:Qwen3-VL-8B-Thinking 显示完全崩溃(ans H AUROC = 0.492); GLM-4.1V-9B-Thinking 显示没有崩溃 (0.716); InternVL3-8B 显示选择性思维(仅 50% 的样本存在链,且 H = 0.675 完整/0.602 仅思考)。在所有三种思维模式模型中,思维链熵优于生成链的子集上的答案熵(分别为 0.647、0.759、0.608 与 0.492、0.716、0.602),这表明只要存在链,链信号就是更可靠的预测器。这对于 Qwen 和 GLM 来说非常成立,但对于 InternVL3 (n_FP = 17) 来说只有边际且统计上不可靠的优势。 300 个样本的 VQAv2 试点证实,在 VQAv2 问题上,链熵 (0.680) 优于答案熵 (0.595),其中自由格式答案的差距最大(0.733 与 0.467)。在较难的推理任务 (HallusionBench) 上,两个 Qwen 模型都显示出中等信号(约 0.64),这与对困难问题的不完整预先承诺一致。我们还记录了结构化弃权影响了 12-22% 的查询,并且对不存在对象查询存在不对称性,并且实用的弃权门在 62.7% 的覆盖率下将准确率从 71.0% 提高到 93.8%,且没有额外的推理成本。