论文

EvoTrainer:面向自主智能体训练的共同演化LLM策略与训练测试架

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

模型训练智能体系统强化学习Agent HarnessAgent SkillsAgentic RL

摘要

自主大语言模型训练通常被视为食谱搜索,这使得训练工具基本上是静态的。这种限制在代理强化学习中更加严重,其中不断变化的瓶颈和标量奖励掩盖了不同的失败模式。我们引入了 EvoTrainer,这是一个自主训练框架,它通过经验反馈共同发展 LLM 政策和训练方面的工具:它诊断执行轨迹级证据,修改诊断,回测干预措施,并积累可重用的技能。在数学推理、竞争性编程代码生成和存储库级软件工程方面进行评估,EvoTrainer 在相同的数据、代码库和评估协议下匹配或超过了人工设计的 RL 参考,并且在长期代理 SWE 上获得了最大的收益。轨迹分析表明,保留的策略在不同领域存在差异,不断发展的诊断阻止了无效的高分分支的提升,可重用的技能塑造了以后的搜索。自主大语言模型强化学习应该超越食谱搜索,转向政策和解释政策的训练工具的联合发展。

EvoTrainer:面向自主智能体训练的共同演化LLM策略与训练测试架:论文配图
图 1:EvoTrainer 概述:一个自主培训框架,共同发展 LLM 政策和培训端诊断工具,超出 SWE-9B 上的人类工程 RL 基线 +4.39 BC%。