论文

权重读写功能:基于激活空间的可扩展参数分解

Weights Read and Write Features: Scalable Parameter Decomposition Grounded in Activation Space

模型评测模型行为与机制分析

摘要

激活空间和参数空间提供了模型计算的互补视图。激活代表信息,而权重则读取、转换和写入该信息。然而,现有的可解释性方法在很大程度上分别研究这两个空间,而没有充分探索所表示的信息和参数级计算之间的联系。我们引入了激活支持的参数分解(ASPD),它联合分解激活和参数空间,并将每个学习到的权重分量基于它读取或写入的激活特征。这种基础使用模型的内部激活来限制其他非唯一的参数分解,而内部重建目标则在所分析的权重矩阵处提供局部学习信号。这些属性共同实现了预训练大语言模型中可扩展、可解释和可因果编辑的参数分解,如 Qwen-3-8B 所示。学习到的读写组件还可以组成参数级机制电路。我们使用 ASPD 来恢复经典 IOI 电路的底层机制,并通过模型权重跟踪语义转换。