论文
邪恶光谱:优化者如何放大或抑制紧急失调
Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment
摘要
紧急错位 (EM) 是最近在 LLM 中发现的一种现象,其中 微调 在执行狭窄的错位任务(例如编写不安全的代码)时,会导致在不相关的提示上出现广泛的错位行为。之前的研究表明,EM 的严重程度对训练选择高度敏感;然而,我们仍然缺乏对这种敏感性的系统描述。我们对几个 Qwen3 模型、优化器、数据集和批量大小进行了扫描,发现优化器的选择影响最大,导致错位率扩大了 7 倍。令人惊讶的是,模型尺寸在 Qwen3 系列中的影响可以忽略不计。使用 Adam 对来自三个系列的 12 个模型进行的额外扫描证实了模型规模 (1B-235B) 和系列对该优化器的影响可以忽略不计。分析 Qwen3-8B 上的损失对齐关系,我们发现最终的对数训练损失是对齐的强大预测因子,并且优化器的分层捕获了几乎所有的残差方差。训练动态表明,每个优化器在损失对齐空间中遵循不同的轨迹,并且经过大量训练后,优化器作为对齐的预测器变得比训练损失更重要。 Muon 是保持最佳对齐的自适应优化器,隐式正则化 LoRA 适配器奇异值的更均匀分布。我们通过使用额外的损失项进行训练来评估这一见解,该损失项激励更平坦的奇异值谱,并发现这基本上恢复了更容易出现 EM 的自适应优化器(Adam 和 Lion)的对齐,而训练损失的成本可以忽略不计。这些结果将优化器的选择确定为 EM 严重性的关键因素,但表明频谱正则化可以显着减轻易出现 EM 的优化器的影响。