论文

我不想你,但我想:视觉语言模型中情态缺失的自解忠实性

I Don't Miss You, but I Do: Self-Explanation Faithfulness of Modality Missingness in Vision-Language Models

模型评测评测方法与指标

摘要

视觉语言模型越来越多地用于某些输入方式可能不可用的环境中,但我们对它们是否能够忠实地解释这些缺失的信息如何影响它们自己的预测知之甚少。我们引入了一种干预协议来评估模态动态的自我解释:模型说明每种模态单独支持什么,恢复缺失的模态是否会改变他们的答案,以及现有的证据是否足够;然后,我们执行相应的模态干预,并将这些声明与模型实现的行为进行比较。我们评估了来自两个模型系列的八个开放权重 VLM,涉及涵盖互补和同构文本图像设置以及多视图驾驶设置的四个任务。我们发现一种系统性的倾向,即夸大现有模态证据的充分性。模型大大低估了恢复缺失模态的效果:任务级别的中值预测变化率最多为 8.8%,而相应的执行变化率达到 72.1%,64 个模型任务条件设置中有 62 个存在预测不足的情况。不足的声明很少见,但在产生时是精确的:恢复模式会改变标记案例中 78-100% 的答案。回顾性的自我解释也显示出同样的趋势:在补充数据上,模型过度相信单一模态的充分性;在同构数据上,他们过度相信相对于其执行行为的单一表示充分性。总之,这些结果表明,VLM 系统地错误描述了其预测如何依赖于可用和缺失的模态证据,从而激发可执行干预措施作为评估多模态自我解释的行为 真值。