论文
解开幻觉:正交语义投影以实现稳健的可解释性
Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability
摘要
随着视觉语言模型越来越多地部署在安全关键型应用中,其解释的可信度变得至关重要。用于视觉语言模型的可解释人工智能(XAI)方法经常会出现语义幻觉,即使提示错误的文本描述,归因图也会突出显示突出的图像区域(例如,在提示“猫”时突出显示狗)。尽管这个问题很普遍,但文献中很大程度上缺少对 XAI 方法和 CLIP 嵌入的正式数学分析。我们证明这种现象并不特定于单一架构,而是高维嵌入空间中线性语义泄漏的基本结果。我们提出了一个统一的理论框架,线性语义归因(LSA),它概括了判别方法。我们引入了 OSP,这是一种几何干预,利用 OMP 的残差属性将独特的语义信号与共享概念分开。我们从理论上证明并从经验上证明,OSP 通过将查询向量与干扰概念正交化,使归因模型对共享特征视而不见,同时保持正确提示的保真度,从而最大限度地减少幻觉。我们的代码位于:https://github.com/emirhanbilgic/Orthogonal-Semantic-Projection