论文

LLM 微调 中进化策略的奖励感知种群规模

Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning

模型训练强化学习

摘要

对 微调 大语言模型 使用进化策略 (ES) 很有吸引力,因为它具有内存高效、并行性,并且与黑盒或离散奖励兼容。然而,它的人口规模结论却存在严重冲突:具有交叉熵(CE)奖励的 微调 在 $N=1$ 时取得成功,而二元奖励训练通常需要 $N \approx 30$。我们表明,这种差距主要与奖励设计和标准化有关,而不是人口规模。在我们研究的能力模型体系中,z 分数优势标准化可能会导致 $N=2$ 失败。禁用归一化可以让 $N=2$ 的二元奖励 ES 在跨越 0.5B-7B 的能力模型上改进 GSM8K 和 TREC,其中归一化变体崩溃或降级。这种小 $N$ 风险是由奖励粒度设置的:二元精度奖励会产生零优势概率 $q$,该概率以封闭形式取决于基本精度、批量大小和对内正确性相关性; Qwen2.5-Instruct/GSM8K 上的零训练探针与 12 种配置中的平均绝对误差为 0.020 的公式相匹配,并发现在这个有能力的模型体系中可用性阈值 $N_{\mathrm{avail}}$ 很小。这并不是说 $N=2$ 是普遍足够的,而是有能力的模型二进制 ES 中的小群体失败可能是一个实现工件,而不是内在的群体限制。