论文
ORCA:退火光谱调节优化器,更快、更好LLM训练
ORCA: The Annealed Spectral Conditioning Optimizer for Faster, Better LLM Training
摘要
现代LLM优化器(例如 Muon)通常会生成比 Adam 具有更高有效秩的权重矩阵,但进一步的频谱控制仅带来了适度的增益。我们发现了这个结果背后的张力:集中的光谱可以抑制耦合权重矩阵中的梯度方向并缓慢优化,而在整个训练中保持的约束可以限制特定于任务的适应并提高可达到的损失底限。我们引入了 ORCA(正交正则化,冷却后),这是一种最小的优化器干预,它在训练早期应用强但临时的软正交正则化,然后将其删除。这使得权重能够在早期从更广泛的范围中受益,并在之后自由调整。在 LLaMA、Qwen3 以及从 130M 到 8B 参数的细粒度专家混合模型中,ORCA 实现了比 Muon 更低的最终验证损失。它相对于 Muon 的损失减少与 Muon 相对于 Adam 的损失减少相匹配或超过。 消融支持先成型、后发布的设计。此外,ORCA 不需要进行架构更改,并且增加的开销也很少。
