论文
线性探头是如何出现的?具有概念目标归因的电路追踪框架
How Do Linear Probes Emerge? A Circuit-Tracing Framework with Concept-Targeted Attribution
摘要
转码器归因图通常经过训练来解释为什么模型将高概率分配给特定的下一个标记。我们引入了概念目标归因(CTA),它相对于线性探测方向训练归因图。因此,CTA 产生了特定于探针的电路,该电路解释了为什么内部概念表示出现在提示中,而与它是否在生成的标记中表达无关。使用跨层转码器,我们表明这些以探针为目标的图包含预测结构:图级特征预测四个广泛研究的概念类别($ρ= 0.91$,$R^2 = 0.84$)的探针准确性,而局部特征则识别驱动每个提示分类的稀疏组件。这将探头性能与可解释的电路结构联系起来,使我们不仅可以询问探头是否工作,还可以询问哪些内部计算使其工作。因果消融进一步表明,探针靶向图和 logits 靶向图捕获了功能上不同的机制。删除与探针相关的特征会降低内部概念分数,同时在很大程度上保留生成的标记,而删除 logits 相关的特征会在 92% 到 100% 的情况下改变生成的标记,对探针分数的影响几乎为零。 CTA 提供了一个框架,用于从行为探针准确性转向探针性能的机械解释,从而能够对内部概念表示(包括安全关键概念表示)进行更详细的审核。我们的代码可在 https://github.com/vedantpalit/concept-targeted-attribution 获取