论文

线性质心假设:当地专家学习的特征作为方向

The Linear Centroids Hypothesis: Features as Directions Learned by Local Experts

模型评测模型行为与机制分析

摘要

线性表示假设(LRH)将经过训练的深度网络(DN)的特征识别为激活空间(即中间层的输出空间)中的线性方向。这种表征将 DN 学习的输入输出映射与其激活空间中特征方向的组织解耦。我们引入了线性质心假设(LCH),它用 DN 质心空间中的线性方向来识别特征——其中任何向量表示质心或局部仿射专家的总结,精确地(例如,对于分段仿射 DN)或近似(例如,对于像 Transformer 这样的平滑 DN)表征 DN 的学习输入输出映射。我们证明,用质心替换中间激活可以产生标准可解释性工具的功能替代方案。根据经验,这种变化在 DINO ViT 上产生了更稀疏、对下游更有用的特征字典,抑制受控任务上的虚假方向,恢复 GPT2-Large 中的可解释电路,并生成忠实的基于梯度的显着性图。 LCH 将字典、探测、电路和显着性图统一为基于网络输入输出图的单个几何对象——通过构造而不是事后使可解释性机械化。研究 LCH 的代码 https://github.com/ThomasWalker1/LinearCentroidsHypothesis 。