论文
资源约束下Agentic LLM后训练的协同演化
Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
摘要
工具使用的大语言模型(LLM)代理生成长且多轮的轨迹,使后训练记忆需求高。进化策略(ES)允许在不后向传播的情况下,以高效的方式进行全参数后训练,最终可以与基于梯度的强化学习(RL)性能相匹配。然而,资源受限的设置通常只有几台GPU,因此ES的高GPU小时需求导致训练时间变得不可行。为了解决这个问题,我们引入了合作参数子空间进化策略(CoPES),这是一种合作竞争方法,将全参数空间分解为低维子空间,并在这些子空间上合作搜索以提高优化效率。我们使用Qwen3.5-4B工具使用代理在数学任务上进行后训练,并在五个难度不同的基准测试上进行评估。在使用全参数GRPO的最佳验证检查点的GPU小时预算下,CoPES恢复了GRPO验证准确性增量的92%,而标准ES的恢复率为67%,其理论上的GPU内存需求仅为GRPO的四分之一。在五个基准测试上的所有评估指标上,CoPES均优于标准ES和基于LoRA的GRPO。进一步的实验还展示了CoPES在问答任务上的优势。这些结果表明,在资源受限的情况下,对于LLM代理后训练,内存需求和训练时间之间的改进平衡。代码在https://github.com/MetaronWang/CoPES公开。
