论文
校准置信度的幻象:视觉语言模型口头置信度与推理轨迹脱节
The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models
摘要
经过校准的视觉语言模型可以反复自我纠正,说“等等,我应重新检查”,最终答错却仍报告高置信度。我们发现,在所评估模型和校准方法中,口头置信度很大程度上独立于推理轨迹。我们从内容变化、token遮蔽和模型自身犹豫标记三个互补角度研究这一现象。结果显示,置信度对轨迹实际包含的内容不够敏感,校准训练甚至可能加重这种脱节。由于ECE和AUROC等现有指标无法检测该问题,我们提出两种互补形式的轨迹依据分数TGS:TGS-self比较模型能否访问自身轨迹时的置信度,TGS-pair则检验模型在视觉、推理和答案维度上,是否给正确轨迹比有缺陷轨迹更高的置信度。我们提出TGS-Bench,一个覆盖十个基准、包含受控正确与错误轨迹对且独立于模型的测试套件,并显示传统校准排名与轨迹依据排名发生分歧,暴露当前评估实践中的盲区。
