论文

EGGROLL,展开:大规模理解和改进低秩进化策略

EGGROLL, Unrolled: Understanding and Improving Low-Rank Evolution Strategies at Scale

模型训练强化学习

摘要

EGGROLL 通过用低秩高斯乘积(通常是一阶)替换密集高斯权重扰动,使进化策略 (ES) 对于 LLM 变得实用。这种选择在计算上很有吸引力,但在几何上很严格:每个一阶扰动都位于环境矩阵空间的零体积子集中,尽管具有恒等协方差。我们描述了有限秩和非零扰动半径下的平均 EGGROLL 更新场,然后分析了其有限总体估计器的误差。总体场是通过对扰动平滑的目标梯度应用显式求解来获得的。我们表明,该解决方案可以引入非保守分量,并且可以逆转最优值的局部稳定性。尽管如此,EGGROLL 对每个等级和半径的每个二次目标都是精确的。对于平滑目标,其第一个局部有限秩校正为 $O(σ^2/r)$,并且非渐近边界控制在平滑假设下产生的场误差。在局部仿射模型下,相对于稠密高斯 ES,秩一扰动仅将梯度估计器的方差增加 $\frac{2(m+n+1)}{mn+1}$,或者对于 $4096\times4096$ 矩阵增加 $0.098\%$。然后,我们引入 LOO-ROLL,一种留一法估计器,它保留有限秩总体域,同时将 EGGROLL 每个方向的两个对立评估替换为一个。在相同的评估成本下,LOO-ROLL 将 Transformer 块中的估计器 MSE 减半。在 10 个 后训练 设置和高达 8B 参数的模型的匹配墙时间中,LOO-ROLL 改善了单独配对测试中的 7 个结果,且没有显着损失。在 GSM8K 测试集上,0.6B 时准确率从 $38.1\%$ 增加到 $63.0\%$,8B 时准确率从 $65.9\%$ 增加到 $80.0\%$。 Transformer 测量恢复了预测的有限排名方差,而排名比较显示排名 8 没有可重现的基于奖励的优势。