论文

基于不连贯性调整语义体积的多模态大语言模型不确定性量化

Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume

模型评测评测方法与指标

摘要

尽管能力强大,多模态大语言模型(MLLM)仍可能产生看似合理却错误的输出,阻碍可靠部署。准确的不确定性度量可以把不可靠的查询升级给人类专家或更大的模型以改进性能。然而,现有不确定性度量存在实际约束,例如仅针对特定模态设计、依赖外部工具或计算代价高昂。我们提出UMPIRE,一个免训练的MLLM不确定性量化框架,它在各种输入与输出模态间高效工作,无需外部工具,仅依赖模型自身的内部模态特征。UMPIRE为给定任务实例计算采样的MLLM响应的不连贯性调整语义体积,有效捕捉样本的全局语义多样性与基于内部模型置信度的响应局部不连贯性。我们提出MLLM的不确定性期望标准,并提供支撑UMPIRE设计的理论分析。大量实验表明,UMPIRE在图像、音频和视频-文本基准(包括对抗与分布外设置)的错误检测与不确定性校准上持续优于基线度量。我们还展示了UMPIRE对非文本输出任务(包括图像与音频生成)的泛化能力。

基于不连贯性调整语义体积的多模态大语言模型不确定性量化
图12:在不同模型上于图像-文本(VQAv2)与音频-文本(SLUE-P2-SQA5)理解数据集开展的消融研究,评估 LN-Ent、Sem.Ent、Eigen 与 UMPIRE 的 AUROC 性能。结果表明,UMPIRE 在各种模型上均持续取得较强的 AUROC,包括用于图像-文本的 Llava-v1.5-7b、Llava-v1.5-13b、Llama-3.2-11B-Vision、 Llama-3.2-90B-Vision 、 cogvlm2-llama3-chat-19B 与 Qwen2.5-VL-7B-Instruct,以及用于音频-文本的 Qwen2-Audio-7B 与 Phi4 。这凸显了我们的方法在不同模型架构上的鲁棒性与有效性。