论文

统一多模态不确定推理

Unified Multimodal Uncertain Inference

模型评测基准与评测资源

摘要

我们引入了统一多模态不确定推理(UMUI),这是一种涵盖文本、音频和视频的多模态推理任务,其中模型必须以任何模态或组合的前提为前提生成经过校准的假设概率估计。虽然文本中已经探讨了不确定推理,但对其他模态的扩展仅限于单模态二元蕴涵判断,没有为其他模态中或跨其他模态的细粒度概率推理留下框架。为了解决这个问题,我们策划了一个人工注释的评估集,其中包含跨音频、视觉和视听设置的标量概率判断,并另外对现有的文本和音频基准进行评估。我们引入了 CLUE(校准潜在不确定性估计),它结合了自洽教师校准和基于分布的置信度探测来产生校准预测。我们证明,我们的 3B 参数模型在所有模态中实现了与零样本基线相同或更强的性能,高达 32B 参数。