论文
LLM 微调 中的对齐动态
Alignment Dynamics in LLM Fine-Tuning
摘要
尽管 大语言模型 (LLM) 通过监督 微调 和来自人类反馈的强化学习实现了强对齐,但在后续的 微调 下,对齐通常很脆弱。现有的解释要么将对齐脆弱性归因于梯度几何,要么将其描述为模型输出中的分布变化,但很少有人提供统一的解释,将 微调 期间的参数空间学习动态与函数空间对齐行为联系起来。在这项工作中,我们引入了一个易于处理的对齐分数,并在 微调 期间导出其封闭形式更新,从而产生了对齐动态的统一框架。我们的分析将对齐更新分解为两个相互竞争的组件:\textbf{\color{red!60!black} Rebound Force},由当前对齐状态和模型分布的窄度共同控制;以及 \textbf{\color{green!60!black} Driving Force},由训练分布如何与对齐和非对齐完成上的结果条件后验对齐来确定。这种分解解释了为什么先前的对齐可以被后来的 微调 逆转,以及为什么更窄的后部结构加强了这种逆转。此外,我们的框架预测了\textbf{排练启动效应}:先前的对齐留下了潜在的后印记,在重新曝光时放大了有效的驱动力,从而导致更快的重新对齐。我们在安全对齐、紧急错位和情绪设置方面验证了这些预测,证明了在重新暴露下一致的对齐反转和加速的重新对齐。此外,安全对准的对照实验证实了反弹强度对后部狭窄的预测依赖性。总之,这些结果为 LLM 微调 期间对齐如何被破坏和重新激活提供了统一的动态视角。