论文
重新布线还是门控?指令调整如何塑造大语言模型中的知识冲突循环
Rewired or Gated? How Instruction Tuning Shapes Knowledge-Conflict Circuits in LLMs
摘要
在语言模型中,相信提示和相信权重之间的选择是由少数可识别的注意力头做出的。指令调整改变了模型在冲突下的行为方式,但它是重新连接底层电路还是仅仅对已经存在的组件进行门控/重新加权,仍然未知。我们提供了三个系列(Llama-3.2-3B、Qwen-2.5-3B、Gemma-3-4B)冲突解决电路的第一个机械基础与指令比较。五种独立的方法,节点和边缘归因、叠加角色分析、因果消融和路径修补,集中在门控上,具有相同的头,在相同的后期层中,被发现被重新加权而不是被高节点重叠(0.60-0.82)取代。在行为上,调整将模型转向参数记忆,使指令模型比基本模型更拒绝简洁的反事实上下文,这与天真的用户遵循期望相反。然而,这种额外的怀疑是框架的一个因素,因为当同样的错误主张作为连贯的、证据性的段落表达出来时,它就会消失。因此,指令调优针对简洁注入所带来的鲁棒性是真实的,但也很有限。更广泛地说,我们认为,由于冲突电路被保留而不是重建,因此在基础模型上校准的可解释性和控制工具应该直接转移到其部署的指导兄弟中。