论文

度量跨模态协同:面向VLM可解释性的基准

Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability

模型评测评测方法与指标

摘要

视觉语言模型(VLM)把复杂视觉输入映射到语义空间,但对VLM跨模态推理的解释目前依赖事后解释器(post-hoc explainer),并以单模态扰动指标来评估。我们揭示该范式的一个局限:由于多模态数据集包含语言先验与模态偏差,VLM经常表现出跨模态冗余,仅凭文本即可回答视觉问题。因此,单模态指标会惩罚忠实的解释器,引发评估崩塌——视觉与文本排名发生根本性矛盾(Kendall's $τ= -0.06$)。为解决这一问题,我们提出协同忠实度(Synergistic Faithfulness, $\mathcal{F}_{syn}$),一个植根于Shapley交互指数的可扩展指标,严格分离模态之间的联合Harsanyi红利,作为高精度替代($ρ= 0.92$),同时实现$24\times$的计算加速。在3个VLM架构与3个基准数据集上对8种不同XAI方法的评估揭示:为VLM提出的解释器严重偏重视觉显著性,在捕获真实跨模态协同方面明显逊于改造后的基于注意力的方法。通过把视觉合理性与跨模态忠实度解耦,本工作提供了在高风险部署中安全审计VLM推理所需的严格评估框架。

度量跨模态协同:面向VLM可解释性的基准:论文配图
图 16:来自 CVBench 的示例 (InternVL2-2B)。该提示需要定位高度具体的小规模物体(“灯开关”)。然而,基于梯度的基线方法(例如,Input×\timesGrad、Integrated Gradients)退化为朴素的边缘检测器。它们描绘了房间的广泛结构轮廓,突出了橱柜和桌子的边缘,而不是所查询的物体。