论文

Hyper-ES:通过下降方向合并改善LLM推理的演化策略

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

模型优化模型训练强化学习模型合并RLVR

摘要

进化策略(ES)作为一种替代方法,用于资源受限的大语言模型(LLM)推理,与基于梯度的微调相比具有显著优势。然而,在高维参数空间中,大多数随机扰动几乎垂直于有用的更新方向,导致优化不稳定。为此,我们提出Hyper-ES,这是一种基于子空间的进化策略框架,避免了在全参数搜索空间中应用ES时的弱点,同时利用其在低维优化中的强项。与直接要求ES从LLM参数空间中随机扰动中发现有用的方向不同,Hyper-ES首先进行少量但成本较低的梯度微调运行,以获得下降方向。尽管每个方向可能仅提供有限的改进,但它们的跨度形成一个紧凑的适应性子空间,能够捕捉有用的推理更新。然后,Hyper-ES将CMA-ES应用于此子空间中的层间DARE-TIES合并系数优化,允许ES在有意义的下降方向组合上搜索,而不是在全模型扰动中随机搜索。我们通过六种数学推理数据集对Hyper-ES进行了评估。结果表明,Hyper-ES相对于GRPO-LoRA平均表现高出1%,同时需要10%更少的空间消耗梯度更新。代码位于https://github.com/kuangrepi/Hyper-ES。

Hyper-ES:通过下降方向合并改善LLM推理的演化策略:论文配图
(a) 用于 LLM 推理的基于梯度的 GRPO (b) 用于 LLM 推理的无梯度 ES (c) 用于合并下降方向 ES 的 Hyper-ES(我们的)图 1:(a) GRPO 使用策略梯度更新模型参数,这通常会消耗资源。 (b) ES为LLM推理提供了无梯度方法,适用于资源受限的场景,但会导致显着的低效率和失控的随机游走。 (c) Hyper-ES 用对快速获得的下降方向系数的低维搜索取代了全参数探索,从而以更少的梯度更新实现更高的 LLM 推理性能。