论文

资源约束下Agentic LLM后训练的协同演化

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

模型训练强化学习参数高效训练RLVRAgentic RL

摘要

工具使用的大语言模型(LLM)代理生成长且多轮的轨迹,使后训练记忆需求高。进化策略(ES)允许在不后向传播的情况下,以高效的方式进行全参数后训练,最终可以与基于梯度的强化学习(RL)性能相匹配。然而,资源受限的设置通常只有几台GPU,因此ES的高GPU小时需求导致训练时间变得不可行。为了解决这个问题,我们引入了合作参数子空间进化策略(CoPES),这是一种合作竞争方法,将全参数空间分解为低维子空间,并在这些子空间上合作搜索以提高优化效率。我们使用Qwen3.5-4B工具使用代理在数学任务上进行后训练,并在五个难度不同的基准测试上进行评估。在使用全参数GRPO的最佳验证检查点的GPU小时预算下,CoPES恢复了GRPO验证准确性增量的92%,而标准ES的恢复率为67%,其理论上的GPU内存需求仅为GRPO的四分之一。在五个基准测试上的所有评估指标上,CoPES均优于标准ES和基于LoRA的GRPO。进一步的实验还展示了CoPES在问答任务上的优势。这些结果表明,在资源受限的情况下,对于LLM代理后训练,内存需求和训练时间之间的改进平衡。代码在https://github.com/MetaronWang/CoPES公开。

资源约束下Agentic LLM后训练的协同演化:论文配图
图1 : CoPES概述。在每个训练步骤中,将模型参数随机划分为KK不相交子空间,并在共享的全模型上下文下在每个子空间内评估N/KN/K扰动。来自所有子空间的奖励被联合标准化,由此产生的子空间估计被组合成一个全参数更新。