论文

SPADE:自适应合成可执行环境中的自我游戏

SPADE: Self-Play in Adaptive Synthetic Executable Environments

模型训练强化学习

摘要

持续的自我完善需要不断扩大的自我生成的、多样化的、适应性的目标。对于语言代理,现有的训练环境池(手工策划、静态合成或冻结验证器)使目标分布随着学习者的扩展而保持固定。我们引入了 SPADE(自适应合成可执行环境中的自玩),这是一种自玩 RL 框架,其中单个 LLM 扮演两个角色:环境设计器,使用 OpenAI Gym 风格的 reset()/step() 接口将完整的长期训练环境编写为可执行代码,以及学习在其中进行操作的推理代理。每个都是一个有状态的多回合环境(状态转换、奖励函数和验证码),因此一个界面涵盖推理问题和多步骤代理工具的使用。推理代理的遗憾是使用有和没有特权提示的奖励之间的差距来估计的;在优化这种遗憾信号时,环境设计师学会以代理能力边缘的环境为目标,同时保持它们的可行性。通过大量的实验,我们发现了几个对成功至关重要的组件:将环境设计器基于从大型预训练语料库中采样的文档,并为其提供累积的环境记忆。扩展到 30B 参数模型时,SPADE 在八个保留的数学、科学、代码和推理基准测试中比最强的固定环境基准平均提高了 +5.3,并将工具使用设置在 BFCL-v4 多轮上提高了 +5.7,在 ACEBench-Agent 上提高了 +13.9;在游戏设置中,最强基线的差距随着模型规模的增加而增长。通过使环境设计本身成为一个可学习的组成部分,SPADE 向开放式自我完善迈出了具体的一步。