论文

揭秘 LLM 电路发现中的差异

Demystifying Variance in Circuit Discovery of LLMs

模型评测模型行为与机制分析

摘要

电路发现是机械可解释性的一项关键技术,可查明对于执行给定任务至关重要的模型组件。尽管当前最先进的方法 (EAP-IG) 在 (un)忠实性 指标上表现良好,但它存在很大的可变性。这包括重采样方差,当我们用来自同一分布的新一批数据进行探测时,电路会发生变化;改写差异,当提示被改写时,发现的电路会发生变化;和样本方差,其中总体不忠性较低的电路在各个样本之间表现出较大的不忠性波动。本文研究了这些差异的根源。我们证明了 CEAP(我们的新电路发现方法)在理论上保证了 EAP-IG 的基础上进行了改进,可以大大减少重采样方差。我们进一步表明,由于不同模板的提示往往会激活模型中的不同电路,因此会出现改写方差。这使我们认为,找到一个解释和控制模型在任务上的行为的综合电路可能具有挑战性,该电路可以用无数模板来表达,这表明 LLM 可能本质上难以操纵。我们表明,稀疏性被认为可以形成更紧凑和可解释的任务电路,但无法解决这个问题。关于样本方差,我们认为它在很大程度上是良性的:极差的不忠实分数通常源于不忠实的定义方式,而不是由于测量电路中的缺陷。我们表明,不忠的程度受到选择性贡献缩放的影响,选择性贡献缩放是一种神经机制,可以解释有时观察到的极差分数。