论文
用于跨模型电路传输的可微分 忠实性 对齐
Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer
摘要
机械可解释性使得定位语言模型中特定行为背后的电路成为可能,但现有方法价格昂贵、特定于模型,并且难以扩展到更大的体系结构。我们引入了 \textbf{可微 忠实性 对齐(DFA)},这是一个通过学习的可微对齐将电路信息从较小的源模型传输到较大的目标模型的框架。 DFA 将源模型节点重要性得分投影到目标模型中,并使用软 忠实性 目标训练此映射,从而避免目标模型上的完整电路发现。我们在事实检索、多项选择推理和算术等六项任务中评估了 Llama-3 和 Qwen-2.5 上的 DFA。最强的结果出现在 Llama-3 $1$B$\rightarrow3$B 上,其中对齐电路通常与直接节点归因竞争,并且零样本传输仍然有效。对于较大的源-目标差距,恢复会减弱,并且 Qwen-2.5 上的恢复要低得多,这表明随着架构和扩展差异的增加,传输变得更加困难。总体而言,DFA 始终优于简单基线,并且在某些设置中,使用 忠实性 恢复目标模型电路,其效果与直接归因相当或更强。这些结果表明,较小的模型可以为较大的模型提供有用的机械先验,同时强调节点级跨模型电路对齐的前景和限制。