论文
训练过度,而非失准
Overtrained, Not Misaligned
摘要
Betley 等人首先证明了紧急错位 (EM),即 微调 在狭窄任务(如不安全代码)上导致不相关领域的广泛错位。 (2025)。我们进行了迄今为止最全面的 EM 研究,重现了最初的 GPT-4o 发现,并扩展到 4 个系列(Llama、Qwen、DeepSeek、GPT-OSS)的 12 个开源模型,参数范围从 8B 到 671B,使用多个随机种子评估了超过一百万个模型响应。我们发现 EM 在 GPT-4o 中复制,但远非普遍:12 个开源模型中只有 2 个(17%)在种子之间表现出一致的 EM,模型大小和 EM 敏感性之间存在显着相关性。通过 微调 期间的检查点级分析,我们证明 EM 在训练后期出现,与主要任务的收敛不同并且在其接近收敛之后出现,这表明 EM 是在任务收敛之后的持续训练中出现的。这产生了实际的缓解措施:提前停止消除了 EM,同时保留了平均 93% 的任务性能,并且仔细的学习率选择进一步将风险降到最低。对医学 微调 的跨域验证证实了这些模式的泛化:大小与 EM 相关性增强(r = 0.90),并且在 67% 的情况下通过提前停止仍然可以避免过度泛化到不真实,尽管语义上接近的训练域产生较少的可分离错位。随着 LLM 越来越多地集成到现实世界的系统中,微调 和强化学习仍然是适应模型行为的主要方法。我们的研究结果表明,通过适当的训练实践,可以避免 EM,将其从不可预见的 微调 风险重新定义为可避免的训练工件。