论文
LLM 可以注释归因图
LLMs Can Annotate Attribution Graphs
摘要
电路追踪是一项令人兴奋的技术,用于揭示语言模型的内部计算,但它需要耗时的手动步骤,将各个特征或 MLP 神经元分组为超级节点。我们提出了一个简单的管道来自动化此步骤:直接将特征描述呈现给语言模型,将它们分组为超级节点。使用自动可解释性指标,我们确认我们的管道生成的超级节点与人类注释者生成的超级节点一样可解释。在两跳 Capitals 任务中,我们的管道在 100 个提示中的 97 个提示中恢复了与中间跳相对应的超级节点。最后,我们使用开放式探索的管道提出了一个简单的概念证明,其中我们自动注释来自维基百科提示完成的 1000 个归因图,然后使用 LLM 判断来标记值得人工审查的有趣图表。我们希望这项工作表明,即使是简单的自动化也可以产生有意义的归因图注释,从而激励自动化电路追踪的进一步工作。