论文

超越静态可解释性:根据 SFT 前参数预测 SFT 后机制,以实现更好的调优

Beyond Static Interpretability: Anticipating Post-SFT Mechanisms from Pre-SFT Parameters for Better Tuning

模型训练参数高效训练

摘要

机械定位通过解释方法隔离关键参数,然后在“定位然后调整”范例中指导参数高效的监督 微调 (SFT),从而在机械可解释性和 后训练 优化之间架起桥梁。然而,由于机械可解释性的回顾性,直接解释 SFT 之前的模型会引入误导性的结论。特别是对于新任务,最初识别的神经元与控制最终模型的神经元有很大不同,引入了主动破坏 SFT 的偏差。为了解决这个问题,我们提出了一个前瞻性的定位框架,该框架仅使用 SFT 前的参数和目标数据集来准确估计 SFT 后的可解释性状态。理论上,我们将 SFT 建模为连续参数演化,利用泰勒展开将后调整机制目标与前 SFT 模型的动态梯度严格连接起来。实际上,我们设计了双粒度(神经元级和组件级)本地化管道。大量的实验表明,我们的方法不仅提供了卓越的 SFT 指导,而且在模型大小不断增加的情况下也表现出了强大的性能和时间可扩展性。这项工作超越了传统可解释性的根本限制——它无法在训练之前识别任务关键型机制——开创了将机械可解释性与目标优化结合起来的预测前沿。