论文

校准置信度的幻象:视觉语言模型口头置信度与推理轨迹脱节

The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models

模型评测评测方法与指标

摘要

经过校准的视觉语言模型可以反复自我纠正,说“等等,我应重新检查”,最终答错却仍报告高置信度。我们发现,在所评估模型和校准方法中,口头置信度很大程度上独立于推理轨迹。我们从内容变化、token遮蔽和模型自身犹豫标记三个互补角度研究这一现象。结果显示,置信度对轨迹实际包含的内容不够敏感,校准训练甚至可能加重这种脱节。由于ECE和AUROC等现有指标无法检测该问题,我们提出两种互补形式的轨迹依据分数TGS:TGS-self比较模型能否访问自身轨迹时的置信度,TGS-pair则检验模型在视觉、推理和答案维度上,是否给正确轨迹比有缺陷轨迹更高的置信度。我们提出TGS-Bench,一个覆盖十个基准、包含受控正确与错误轨迹对且独立于模型的测试套件,并显示传统校准排名与轨迹依据排名发生分歧,暴露当前评估实践中的盲区。

校准置信度的幻象:视觉语言模型口头置信度与推理轨迹脱节:论文配图
图1:(a)即使反复表达自我怀疑,经校准的VLM仍可能给错误答案高置信度,置信度与轨迹脱节。(b)结果级指标未发现这一问题:VL-Calibration-8B的ECE为0.081,看似校准良好,但校准后TGS-self变负、TGS-pair下降。