论文

微调下安全回归的引力解释

A Gravitational Interpretation of Safety Reversion under Fine-Tuning

模型评测模型行为与机制分析

摘要

即使数据和目标都不是故意对抗的,大语言模型 中的安全对齐也会在 后训练 期间降低。对准反弹和反向动力学表明,这种退化可能会重新激活安全对准期间抑制的行为。基于这些想法,我们假设普通的非对抗性 后训练 遵循反转方向:激活空间从安全对齐模型转向更宽松、更早期的仅有帮助的状态。我们看到,对于 Llama,跨参考、任务和种子的每个测试轨迹都超过了匹配的经验零值,而在对齐的 Llama 和 Qwen 检查点,词汇读数显示该方向局部有利于任务参与而不是固定的拒绝式空缺。它的几何表达式在行为上提供了丰富的信息:随着 后训练 的进行,方向一致和危害性一起增加,产生很强的描述性相关性(Spearman r=0.958)。为了超越相关性,我们使用从该坐标构建的目标来测试适应过程中的因果相关性。在从 3B 到 14B 的所有测试 Llama、Qwen 和 Gemma 设置中,与普通 微调 相比,优化器匹配的反对正向运动的物镜减少了几何对准和有害性,而单独稳定的增强运动的物镜则增加了两者。每个模型和规模都表现出相同的平均块基线推送排序,这表明回归方向的因果相关性与一种架构或模型大小无关。最后,我们表明,在无法获取方向的情况下构建的标准安全演练目标独立地反对它,并将 Llama 和 Qwen 的累积回归减少了约 30%。