论文

用于高效电路提取的稀疏权重分解

Sparse Weight Decomposition for Efficient Circuit Extraction

模型评测模型行为与机制分析

摘要

密集的预训练 Transformer 不会自然地暴露可解释单元以进行电路提取。现有方法通过学习辅助稀疏表示或训练稀疏模型来获得此类单元,这会产生大量额外的计算,同时可能会在正在分析的表示与原始预训练模型之间引入保真度差距。我们提出稀疏权重分解(SWD),它通过将每个权重矩阵分解为两个稀疏因子来重新参数化预训练的线性投影,这两个稀疏因子的共享中间坐标用作单独可寻址的电路单元。无需训练单独的替换网络,这种参数表示就支持与学习稀疏特征的方法相同的评分、选择和消融电路提取工作流程。在单矩阵替换中,SWD 与转码器和其他强基线所实现的保真度相匹配,同时使用这些基线用于训练其替换的数据不到 1%。为了匹配替换保真度,SWD 在 GPT-2、Qwen2.5 和 Qwen3.5-27B 上的任务中以更少的活动读/写边缘和选定单元达到相同的电路充足性和必要性目标。我们进一步表明,在 微调 非零因子值之后,SWD 对于所有注意力和 MLP 权重矩阵的全模型替换仍然有效。最后,SWD 还具有零数据变体,允许更广泛地使用机械可解释性分析(例如每步分析)。