论文

CoMet:多模态不确定性估计的上下文和多重性分解

CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation

模型评测鲁棒性、公平性与可信度评测

摘要

不确定性估计一直是人工智能模型中长期存在的挑战;它相当于“知道你不知道的事情”,而元认知即使对于人类来说也是出了名的困难(参见邓宁-克鲁格效应)。尽管即使在更简单的分类系统中,这个问题还远未得到解决,但在多模态 大语言模型 (MLLM) 中解决这个问题正变得越来越重要。在 MLLM 中,不确定性可能源于任何不同的来源及其关系,并且进一步可能源于开放式环境中的无限答案。为了解决这些问题,我们提出了 CoMet,这是一种 MLLM 不确定性估计方法,通过将不确定性分解为特定于上下文的项和特定于多重性的项。前者捕获由给定上下文(例如任务或提示)引起的歧义,而后者捕获由上下文确定的有多少看似合理的答案与给定输入保持兼容。我们训练一个轻量级的事后不确定性模块来估计这些量,这可以实现有效的不确定性估计,而无需自回归答案生成或重复采样。对各种开放式多模态基准、幻觉检测和多项选择视觉问答基准的实验表明,CoMet 持续改进了现有基准的不确定性估计,同时在实践中保持高效。代码可在 https://github.com/princetonvisualai/comet_uncertainty 获取