论文

扩展本质上可解释的语言模型

Scaling Inherently Interpretable Language Models

模型训练预训练

摘要

可解释性通常被视为对能力的征税:语言模型被训练为不透明的系统,然后在事后用难以建立可靠性的方法进行解释。在这项工作中,我们挑战这个前提。我们不是对模型进行逆向工程,而是将可解释性作为训练管道的约束,并与语言建模目标一起进行优化。在三个数量级的计算中,在自回归和扩散语言模型上,可解释性与能力成正比,而不是相反。令人惊讶的是,模型表示在规模上变得更加解开并与人类可理解的概念保持一致。我们使用 Steerling-8B 实例化训练时间配方,Steerling-8B 是一种带有因果注意掩模的扩散语言模型。对于任何一组生成的标记,Steerling-8B 将输出归因于相关的输入标记、人类可理解的概念和训练数据。这可以实现闭环干预:通过概念或特征归因来诊断输出,检索类似的训练数据,并通过概念引导来纠正行为,而无需重新训练。 Steerling-8B 与训练有素 2-16 倍计算量的开放对等模型相比仍然具有竞争力,这表明了一种不同的扩展范式:可解释性可以设计到训练中,并且随着规模的扩大而提高。