论文
Hyper-ES:通过下降方向合并改善LLM推理的演化策略
Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging
摘要
进化策略(ES)作为一种替代方法,用于资源受限的大语言模型(LLM)推理,与基于梯度的微调相比具有显著优势。然而,在高维参数空间中,大多数随机扰动几乎垂直于有用的更新方向,导致优化不稳定。为此,我们提出Hyper-ES,这是一种基于子空间的进化策略框架,避免了在全参数搜索空间中应用ES时的弱点,同时利用其在低维优化中的强项。与直接要求ES从LLM参数空间中随机扰动中发现有用的方向不同,Hyper-ES首先进行少量但成本较低的梯度微调运行,以获得下降方向。尽管每个方向可能仅提供有限的改进,但它们的跨度形成一个紧凑的适应性子空间,能够捕捉有用的推理更新。然后,Hyper-ES将CMA-ES应用于此子空间中的层间DARE-TIES合并系数优化,允许ES在有意义的下降方向组合上搜索,而不是在全模型扰动中随机搜索。我们通过六种数学推理数据集对Hyper-ES进行了评估。结果表明,Hyper-ES相对于GRPO-LoRA平均表现高出1%,同时需要10%更少的空间消耗梯度更新。代码位于https://github.com/kuangrepi/Hyper-ES。
