论文
扎根还是猜测?通过盲图对比排序进行 LVLM 置信度估计
Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking
摘要
大型视觉语言模型(LVLM)存在视觉不基础的问题:它们可以产生完全由语言先验驱动的流畅、自信甚至正确的响应,而图像对预测没有任何贡献。现有的置信度估计方法无法检测到这一点,因为它们在正常推理下观察模型行为,没有机制来确定预测是由图像还是仅由文本形成。我们引入 BICR(盲图像对比排名),一种与模型无关的置信度估计框架。 LVLM 完全冻结;相反,我们对每个样本提取其隐藏状态两次,一次使用真实的图像-问题对,一次使用在问题固定时图像变黑的情况。然后,在真实图像隐藏状态上训练一个小型独立探针,并通过排名损失进行正则化,该排名损失会惩罚黑色视图上的较高置信度,教导其将视觉视觉依据关联视为可靠性信号。在推理时仅使用单个真实图像通道,因此 BICR 在标准单视图探针的基础上增加了零成本。在涵盖视觉问答、物体幻觉检测、医学成像和财务文档理解的基准上对五个现代 LVLM 和七个基线进行评估后,BICR 在校准和辨别方面同时实现了最佳跨 LVLM 平均值,统计显着的辨别增益对集群感知分析具有鲁棒性,参数比最强探测基线少 4-18 倍。