论文

VL-Calibration:大型视觉语言模型推理的解耦置信度校准

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

模型训练强化学习

摘要

大视觉语言模型(LVLM)实现了强大的多模态推理,但经常表现出幻觉和高确定性的错误响应,这阻碍了它们在高风险领域的使用。现有的语言化置信度校准方法主要是为纯文本 LLM 开发的,通常使用二进制答案级别正确性来优化单个整体置信度得分。这种设计与 LVLM 不匹配:不正确的预测可能源于感知失败或给出正确感知的推理错误,并且单一置信度将这些来源混为一谈,而视觉不确定性通常由语言先验主导。为了解决这些问题,我们提出了 VL-Calibration,这是一种强化学习框架,可将置信度明确地解耦为视觉置信度和推理置信度。为了在没有 真值 感知标签的情况下监督视觉置信度,我们引入了一种内在视觉确定性估计,该估计结合了(i)通过图像扰动下的 KL 散度测量的视觉基础和(ii)通过词元熵测量的内部确定性。我们进一步提出 词元级 优势重新加权,以基于视觉确定性的标记优化重点,抑制无根据的幻觉,同时保留有效的感知。对 13 个基准的实验表明,VL-Calibration 有效地改进了校准,同时提高了视觉推理的准确性,并且它可以推广到跨模型规模和架构的分布外基准。