论文

本能与反思:统一多模式大型模型中的词元和语言化信心

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

模型评测鲁棒性、公平性与可信度评测

摘要

多模态 大语言模型 (MLLM) 在各种感知和推理任务中表现出了卓越的能力。尽管取得了如此成功,但确保其在实际部署中的可靠性需要强大的置信度估计。之前的工作主要集中在纯文本 LLM,通常依赖于计算成本高昂的自一致性采样。在本文中,我们将其扩展到多模态设置,并对 MLLM 的响应置信度估计进行全面评估。我们的分析揭示了明显的本能反射偏差:模型的隐式 词元级 支持经常与其口头自我评估信心相背离。为了解决这种不一致问题,我们提出了一种单调置信融合框架来合并双通道信号和跨通道一致性来估计正确性。随后,应用保序均值对齐步骤来纠正全局偏差,这改进了校准,同时保留了选择性预测的风险覆盖权衡。对各种开源和闭源 MLLM 的实验表明,我们的方法始终能够产生更可靠的置信度估计,并改进校准和故障预测。代码可在 https://github.com/Yunkaidang/Instinct-vs.-Reflection 获取。