论文

用于解释的可扩展电路学习 大语言模型

Scalable Circuit Learning for Interpreting Large Language Models

模型评测模型行为与机制分析

摘要

机械可解释性的一个突出研究方向是学习 LLM 组件上的稀疏电路,以揭示它们如何共同产生模型行为。然而,原始神经元是多义的,使得学习的电路难以解释。稀疏自动编码器(SAE)功能缓解了这一问题,但它们的高维性使得现有的基于干预的电路学习方法在计算上令人望而却步。我们提出了 CircuitLasso,一种基于稀疏线性回归的可扩展电路学习方法。 CircuitLasso 恢复的电路的结构精度与基准数据上最先进的基于干预的方法相匹配,而计算成本仅为其一小部分。为了实现可解释性,CircuitLasso 有效地揭示了 SAE 特征之间的关系,展示了人类可解释的语义特征如何在模型中传播并影响其预测。最后,我们通过利用他们的见解在域泛化任务上以低得多的成本实现可比较的性能,从而验证了我们学习的电路的实用性。