论文

DART-ES:以难度重权与定向重放改进仅前向 LLM 训练

DART-ES: Difficulty-Aware Reweighting and Targeted Replay for Fine-Tuning LLMs with Evolution Strategies

模型训练强化学习

摘要

进化策略(ES)只需前向计算即可对大语言模型进行内存高效的全参数微调。然而,标准 ES 对各题奖励均匀平均,将题目级种群反馈压缩为单个标量,难以体现每题学习价值如何随模型能力改变。我们提出 DART-ES,即难度感知重加权与定向重放。它用扰动种群的通过率估计每题局部可解性,聚合历史观测形成动态难度状态,同时指导连续难度重加权及稀有可解样本重放,无需额外难度模型或反向传播。实验中,它在五个底座上均超过 ES,在 GSM8K 将平均准确率从72.07\%提高到73.53\%,超过 GRPO 的73.26\%。五个困难数学基准平均准确率为49.20\%,ES为48.34\%,与使用RL训练的强7B模型具有竞争力。14B模型在指令微调、代码生成和Countdown任务上也有一致收益,显示跨任务泛化和规模扩展。相比GRPO,每步运行时间减少15.2\%—50.2\%,每GPU峰值内存减少21.1\%—51.1\%;即使全参数微调,其运行时间和显存需求也低于GRPO+LoRA。