论文
度量跨模态协同:面向VLM可解释性的基准
Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability
摘要
视觉语言模型(VLM)把复杂视觉输入映射到语义空间,但对VLM跨模态推理的解释目前依赖事后解释器(post-hoc explainer),并以单模态扰动指标来评估。我们揭示该范式的一个局限:由于多模态数据集包含语言先验与模态偏差,VLM经常表现出跨模态冗余,仅凭文本即可回答视觉问题。因此,单模态指标会惩罚忠实的解释器,引发评估崩塌——视觉与文本排名发生根本性矛盾(Kendall's $τ= -0.06$)。为解决这一问题,我们提出协同忠实度(Synergistic Faithfulness, $\mathcal{F}_{syn}$),一个植根于Shapley交互指数的可扩展指标,严格分离模态之间的联合Harsanyi红利,作为高精度替代($ρ= 0.92$),同时实现$24\times$的计算加速。在3个VLM架构与3个基准数据集上对8种不同XAI方法的评估揭示:为VLM提出的解释器严重偏重视觉显著性,在捕获真实跨模态协同方面明显逊于改造后的基于注意力的方法。通过把视觉合理性与跨模态忠实度解耦,本工作提供了在高风险部署中安全审计VLM推理所需的严格评估框架。
