论文

通过旧地图导航:LLM 中静态机械定位的陷阱 后训练

Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training

模型评测模型行为与机制分析

摘要

“定位然后更新”范例已成为 大语言模型 (LLM) 的 后训练 中的主要方法,通过机械可解释性识别关键组件以进行目标参数更新。然而,这种范式基于一个基本但未经验证的假设:从当前静态参数派生的机制能否可靠地指导未来的动态参数更新?为了研究这一点,我们系统地跟踪了 Transformer 电路在整个监督 微调 (SFT) 过程中的结构演化,揭示了任务机制的潜在动态。我们引入了三个新颖的指标——电路距离、电路稳定性和电路冲突——来分析三个维度的电路演化:神经迁移、语义稳定性和跨任务干扰。我们的实证结果表明,电路在参数更新期间本质上表现出“自由进化”。因此,从当前状态提取的静态机制不可避免地会受到时间延迟的影响,使得它们从根本上不足以指导未来状态。此外,通过解构现有方法中的“有效性幻觉”,这项工作强调了机械定位中“远见”的必要性,并为未来的研究提出了预测框架。