论文
本地化语言模型中的锚定路径
Localizing Anchoring Pathways in Language Models
摘要
提示中不相关的数字可能会改变语言模型的判断,从而在数字推理中产生锚定效应。我们使用具有共享答案选项的受控多项选择设置来研究这种锚敏感信号在语言模型中的携带位置。我们定义一个 logits 差异度量,将正确答案选项与锚点对应的答案选项进行比较,并验证它是否跟踪行为锚定。在 7B--8B Qwen 和 Llama 基础和指令调整模型上使用基于归因的电路定位,我们发现边缘级方法比节点级方法更忠实地恢复该信号。低锚定电路和高锚定电路在模型内强烈转移,表明跨锚定方向的共享通路结构。然而,跨基础和指令调整变体的稀疏传输不太可靠,这表明 后训练 改变了最重要的途径。总的来说,我们的结果提供了与锚定相关的决策信号如何在语言模型内携带的机制解释。