论文
FUSE:通过贝叶斯融合认知和任意不确定性来量化视觉语言模型中的不确定性
FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty
摘要
视觉语言模型 (VLM) 在多个领域发挥着越来越重要的作用。在许多应用中,例如机器人技术,量化这些模型输出的不确定性至关重要。我们开发了 FUSE,一个概率框架,用于捕获视觉语言建模中两个互补的不确定性来源:(i)从输入数据视觉语言模糊性导出的任意嵌入级不确定性,以及(ii)从 VLM 的语义响应多样性估计的认知模型级不确定性。我们的方法制定了贝叶斯融合机制,该机制通过分析结合这些不确定性源以产生不确定性的标量度量。此测量可用于可靠地预测下游应用程序的模型输出正确性。我们证明我们的方法优于基线并实现了 SOTA 不确定性校准。