论文

Agentic ESOpt:具有最低 GPU 要求的 微调 长视野 LLM 代理

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

模型训练参数高效训练

摘要

强化学习(RL)在单轮 LLM 微调 中很有前景。然而,长视野代理推理引入了越来越多的分支交互和稀疏奖励,暴露了强化学习的一些局限性:其重量级的基于反向传播的训练堆栈使得微调更大的 LLM 变得不切实际,而更长视野的轨迹使强化学习中的信用分配变得更加困难。本文认为,进化策略(ES)对于 微调 长视野 LLM 智能体来说可能是更好的选择。与代理强化学习相比,ES 具有三个关键优势: 1)模型可扩展性:ES 只需最少的推理级 GPU 内存即可实现全参数优化,从而可以对大型 LLM 进行微调。 2)灵活性:其轻量级的黑盒反馈接口使得ES 微调易于与即时空间演化(例如技能优化和测试时计算)组合; 3)长视野可扩展性:ES执行轨迹级参数归因,而无需分解跨视野的奖励,随着视野长度的增长,产生比Agentic RL更好的可扩展性。基于这一见解,我们提出了 Agentic ESOpt,这是一个专为灵活的参数-上下文协同进化而定制的全参数代理 微调 框架。在每一步中,Agentic ESOpt 都会对当前 LLM 参数周围的扰动进行采样,用奖励评估生成的代理,并应用在线奖励加权更新。为了改善探索-适应权衡,Agentic ESOpt 进一步引入了扰动尺度 $σ$ 的余弦衰减表。在WebArena-Lite上,Qwen-3.5-27B的全参数优化将No Skill基线提高了6.69%。在测试时自动启发式设计中,Agentic ESOpt 执行在线提示-参数协同进化,在 36 个设置中的 28 个设置中改进其匹配基线。