论文

几何自适应解释器在分布偏移下实现基于字典的忠实可解释性

Geometry-Adaptive Explainer for Faithful Dictionary-Based Interpretability under Distribution Shift

模型评测模型行为与机制分析

摘要

机械可解释性旨在通过识别因果关系的内部结构来解释模型的行为。基于字典的解释器(例如稀疏自动编码器和转码器)是主要工具,但它们在分布外(OOD)移位下的 忠实性 很少受到系统关注。我们表明,分布偏移会旋转模型主动使用的子空间,从而使在分布内(ID)激活上训练的解释器字典错位。我们将这种错位形式化为 忠实性 间隙,即 ID 字典和 OOD 活动子空间之间的几何距离,并表明它控制 OOD 忠实性 退化。为了缩小这一差距,我们提出了几何自适应解释器(GAE),它将解释器的字典与 OOD 活动子空间重新对齐,同时保留原始特征结构。这仅需要未标记的 OOD 激活并且不需要梯度更新。我们证明 GAE 比未适应的 ID 解释器有所改进,超额损失以二阶矩位移的二次方为界。根据经验,GAE 甚至在多个模型和 OOD 设置中的因果 忠实性 中匹配或超过所有基于训练的基线。