论文

规模化单义性:从Claude 3 Sonnet提取可解释特征

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

模型评测模型行为与机制分析

摘要

我们证明稀疏自编码器能够从生产级规模的语言模型Claude 3 Sonnet中提取可解释特征,回答了字典学习方法能否扩展到小型transformer之外的开放问题。我们在该模型中间层残差流上训练了拥有多达3400万特征的稀疏自编码器,并利用缩放定律指导超参数选择。所得特征具有多语言与多模态特性(尽管仅在文本上训练,却能泛化到图像),既响应概念的具体实例也响应抽象讨论,并且可用于以与其解释一致的方式引导模型行为。我们发现了对应著名实体和地点的特征,以及讽刺、代码错误等更抽象概念的特征。我们还识别出与语言模型可能造成危害的方式相关的特征——包括代表欺骗、权力寻求、谄媚与偏见的特征——并证明操纵这些特征会对模型输出产生因果影响。此外,我们对特征的可解释性、几何结构与计算功能进行了分析。然而,重大局限依然存在:我们的特征集合并不完备,而且我们缺乏严谨的方法来评估这些特征是否忠实捕捉了模型计算。