论文
ADAG:自动描述归因图
ADAG: Automatically Describing Attribution Graphs
摘要
在语言模型可解释性研究中,\textbf{电路追踪}旨在识别哪些内部特征对特定输出有因果贡献以及它们如何相互影响,目的是解释某些行为背后的计算。然而,所有先前的电路跟踪工作都依赖于对电路中每个功能所扮演的角色的临时人工解释,通过手动检查数据工件(例如组件激活的数据集示例)。我们引入 \textbf{ADAG},这是一个用于描述这些完全自动化的归因图的端到端管道。为了实现这一目标,我们引入了 \textit{attributionprofiles},它通过输入和输出梯度效应来量化特征的功能作用。然后,我们介绍了一种用于对特征进行分组的新颖的聚类算法,以及一个 LLM 解释器 - 模拟器设置,它可以生成这些特征组的功能角色的自然语言解释并对其进行评分。我们在已知的人工分析电路跟踪任务上运行我们的系统并恢复可解释的电路,并进一步表明 ADAG 可以找到可操纵集群,这些集群对 Llama 3.1 8B Instruct 中的有害建议越狱负有责任。