论文

ScaleEnv:从零合成可扩展环境以训练通用交互式工具使用智能体

ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training

模型训练合成数据

摘要

训练能够适应多样场景的通用智能体,需要可供自主探索的交互式环境。然而,交互式环境仍然极度稀缺,且现有合成方法在环境多样性与可扩展性方面存在显著局限。为应对这些挑战,我们提出 ScaleEnv,一个完全从零构建完全交互式环境与可验证任务的框架。具体而言,ScaleEnv 通过程序化测试确保环境可靠性,并通过工具依赖图扩展与可执行动作验证来保证任务的完整性与可解性。通过让智能体在 ScaleEnv 内通过探索进行学习,我们在 τ²-Bench 与 VitaBench 等未见过的多轮工具使用基准上展示了显著的性能提升,凸显出强大的泛化能力。此外,我们研究了领域数量增加与模型泛化性能之间的关系,为环境多样性扩展对鲁棒智能体学习至关重要提供了实证证据。

ScaleEnv:从零合成可扩展环境以训练通用交互式工具使用智能体
图2:基于图扩展的任务实例化(Task Instantiation via Graph Expansion)总体流程。该过程包括:(1) 从依赖图进行种子链采样(Seed Chain Sampling);(2) 带有可验证执行的任务初始化(Task Initialization);以及 (3) 受控环境扩展(Controlled Environment Expansion),在保持可解性的同时扩展任务复杂度。