论文
终端智能体的环境演化
Environment Evolution for Terminal Agents
摘要
扩展交互式和可验证的环境对于训练终端代理至关重要。随着前沿模型变得更加强大,从头开始合成的环境变得不那么具有挑战性,从而提供有限的学习信号。最近的协同进化方法根据采样轨迹期间暴露的弱点迭代地合成模型可学习边界附近的环境。然而,随着模型变得更强,它们同策略采样轨迹的依赖限制了泛化和持续提供学习信号。在本文中,我们提出了环境进化,它离策略逐渐增加环境难度,并在训练期间一代又一代地安排进化的环境,以提供持续的学习信号。我们从多轮学习目标中得出影响环境难度的三个进化方向,然后通过循环工程的多智能体工具沿着这些方向实现进化。 Hy4 预览版、Claude Opus 5 和 GPT-5.6 Sol 的定量采样轨迹实验表明,环境演变始终会产生更困难的环境。我们通过简单的长视野 RL 训练在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上验证了其有效性,分别将其在 Terminal-Bench 2.1 上的性能提高了 14.4 和 18.0 个百分点。