论文

AutoGym:蓝图先行的可验证Agent训练场生成

AutoGym: Blueprint-First Generation of Verifiable Agent Gyms

模型训练强化学习合成数据Agentic RL

摘要

用强化学习训练Agent需要一个训练场(gym):包含任务、可尝试任务的可执行环境,以及能可靠区分成功与失败的验证器。构建此类训练场仍然依赖人工、成本高昂且静态不变。随着模型进步与污染暴露,任务集会饱和。合成生成可提供规模,但单次合成产出的任务难度大多只是表面文章:能力相当的模型尽管面对晦涩表述也能解出,正确性还得事后由不可靠的LLM裁判裁决。我们提出AutoGym,一个从最小领域种子或先验模型轨迹生成完整训练场(任务、可执行环境与验证器)的框架。AutoGym引入三种机制:(1)蓝图先行生成——在环境落地之前规定有效解空间、环境要求与验证标准,使可解性成为构造前提而非事后属性;(2)显式生成参数——控制任务拓扑、交互深度、能力轴、问题混淆与干扰项构成,实现细粒度难度调节;(3)主动课程合成——依据模型能力演化,用性能信息校准来调整这些参数的分布。在生产力与时间推理设定中,AutoGym生成的训练场覆盖整个能力谱,包括能挑战前沿模型的实例。

AutoGym:蓝图先行的可验证Agent训练场生成:论文配图
图 2:在指令遵循训练环境中 500 步强化学习的训练奖励。持续的提升证实了所生成的任务能提供可学习的信号。