论文
匹配精度,不同的几何形状:LLM 后训练 中的进化策略与 GRPO
Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM Post-Training
摘要
进化策略 (ES) 已成为基于 LLM 微调 的强化学习的可扩展无梯度替代方案,但目前尚不清楚可比较的任务性能是否意味着参数空间中可比较的解决方案。我们在单任务和顺序持续学习设置中比较了四个任务中的 ES 和组相对策略优化 (GRPO)。 ES 在单任务精度上达到或超过 GRPO,并且在控制迭代预算的情况下保持连续竞争力。尽管任务性能相似,但这两种方法产生明显不同的模型更新:ES 做出更大的变化并引起更广泛的任务外 KL 漂移,而 GRPO 进行更小的、更局部的更新。引人注目的是,ES 和 GRPO 解决方案是线性连接的,没有损失障碍,尽管它们的更新方向几乎是正交的。我们开发了一种 ES 的分析理论,可以在统一的框架内解释所有这些现象,展示 ES 如何在信息量较弱的方向上积累大量的脱任务运动,同时仍然在任务上取得足够的进展,以在下游精度方面与基于梯度的 RL 相匹配。这些结果表明,无梯度和基于梯度的 微调 可以达到同样准确但几何上不同的解决方案,对遗忘和知识保存产生重要影响。源代码已公开:https://github.com/Bhoy1/ESvsGRPO。