论文

解开词汇空间中的 MLP 神经元权重

Disentangling MLP Neuron Weights in Vocabulary Space

模型评测模型行为与机制分析

摘要

解释语言模型权重中编码的信息仍然是机械可解释性的基本挑战。在这项工作中,我们引入了 ROTATE(权重空间中的旋转优化词元对齐),这是一种无需前向传递的无数据方法,可以直接在权重空间中解开 MLP 神经元。我们的方法依赖于一个关键的统计观察:编码连贯、单义概念的神经元在投影到模型词汇表上时表现出高峰度。通过优化神经元权重的旋转以最大化其词汇空间峰度,我们的方法恢复了稀疏的、可解释的方向,我们将其命名为词汇通道。 Llama-3.1-8B-Instruct 和 Gemma-2-2B-it 上的实验表明,ROTATE 始终如一地恢复忠实于神经元行为的词汇通道;消融单个通道会选择性地禁用相应的输入激活或特定概念的提升。此外,聚合通道级描述可产生全面的神经元描述,在头对头比较中,其性能比优化的基于激活的基线高 2-3 倍。通过提供神经元权重的无数据分解,ROTATE 为解释语言模型提供了可扩展的细粒度构建块。