论文

了解 LLM 推理的进化策略:比 GRPO 更广泛的推理覆盖范围

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

模型评测模型行为与机制分析

摘要

进化策略(ES)最近作为一种用于 LLM 推理的内存高效 后训练 范例而出现。然而,ES 的优化行为仍未得到充分研究,因此很难定义其与主流 后训练 范式(例如组相对策略优化(GRPO))相比的优势范围。通过系统地研究 ES 动力学和机制,本文首先确定了 ES 相对于 GRPO 的性能优势,从理论上和实证上表明 ES 可以带来更广泛的推理覆盖范围,从而更好地利用预训练的 LLM 的推理能力。理论上,我们表明验证者预测的 ES 群体的 Jensen-Shannon 多样性有助于提高 Pass@K 性能。根据经验,与表现出熵崩溃的 GRPO 不同,ES 改进了 Pass@1,同时获得了比 GRPO 更高的 Pass@K。我们进一步开发了一种连续的 GRPO-ES 训练策略,将 GRPO 在 Pass@1 中的优势与 ES 在 Pass@K 中的优势结合起来。其次,我们发现,尽管整体模型参数漂移很大,但 ES 的任务性能增益仅对较大幅度更新的稀疏子集有贡献。这种功能稀疏性表明,大参数移动不一定意味着广泛的功能变化,并且坚持的评估进一步表明,它并不一定会导致灾难性遗忘。最后,我们研究超参数设计如何影响 ES 的有效性,证明 ES 在较大的 LLM 中需要较小的群体规模。这些发现将 ES 定位为一种独特的推理 后训练 范式,而不是 GRPO 的效率较低、内存效率较低的替代方案。