论文

AgentMercury:您的代理可以为大规模业务场景综合可验证的环境

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

模型训练合成数据

摘要

代理通过与环境交互来学习行动,但用于训练的环境通常是围绕预定义的任务和基准手动构建或合成的。这种以任务为中心的范例使得很难扩展反映现实和不断发展的工作流程的环境,在这些环境中,不同的任务可以自然地从底层世界中出现。我们引入 AgentMercury,这是一个可扩展框架,用于从高级业务场景合成可执行环境。 AgentMercury 不是为特定任务构建环境,而是首先实例化一个包含实体、服务、工具、状态和可执行跨服务不变量的持久世界,随后可以从中出现不同的任务和交互轨迹。我们构建了跨越 14 个行业和 50 个国家的 4,783 个可执行环境,并将它们用作强化学习的训练基础。尽管生成时并未针对评估基准,但在这些面向业务的环境中训练的策略在企业工作流程和跨越推理、编码、科学计算和工具使用的域外基准方面都得到了显着改善。在我们的实验中,在 AgentMercury 环境中进行训练后,Qwen3.5-4B 在 EnterpriseOps-GYM 上从 12.3 提高到 15.7,在 AIME26 上从 45.9 提高到 56.0。我们进一步表明,构建过程本身是可以学习的:构建跟踪上的 微调 Qwen3.5-35B-A3B 将保留业务场景中的可执行世界创作成功率从 3.3% 提高到 83.3%。这些结果表明,基于场景的环境可以提供超越特定基准训练的有用且可概括的学习信号,而它们的构建本身可以成为一种可学习的能力。