论文

因果不变掩码揭示MLLM的认知不确定性

Revealing Epistemic Uncertainty in MLLMs via Causal-Invariant Masking

模型评测评测方法与指标

摘要

多模态大语言模型(MLLM)饱受幻觉困扰,对不确定性量化(UQ)产生关键需求以确保可靠部署。但现有方法难以检测由表面关联引起的不确定性,尤其当查询相关信号微弱时。我们主要把该问题归因于其偏向数据歧义引起的偶然不确定性、忽视模型局限导致的认知不确定性。为进一步分解不确定性类型实现全面UQ,我们提出因果不变掩码(CIM):度量原始预测与以因果聚焦视图为条件的预测之间的语义偏移。基于该框架,我们引入语义偏移作为UQ核心指标,并给出理论证据表明其收敛于模型对非因果相关敏感度的方差,确立其捕捉MLLM局限的能力。为加速MLLM的UQ,我们进一步提出期望嵌入漂移(EED)——直接在超球嵌入空间估计语义偏移的快速几何代理指标。实验显示该方法在多基准上取得SOTA性能,同时EED加速近50%且性能相当。