论文
EnterpriseGym Corecraft:在高保真 RL 环境中训练通用智能体
EnterpriseGym Corecraft: Training Generalizable Agents on High-Fidelity RL Environments
摘要
我们表明,在高保真强化学习环境中训练 AI 智能体,能产生超越训练分布的泛化能力。我们推出 CoreCraft,它是 Surge AI 的 Agentic RL 环境套件 EnterpriseBench 中的首个环境。CoreCraft 是对客户支持组织的完全可运行企业模拟,包含 14 类共 2500 多个实体和 23 种独特工具,旨在衡量 AI 智能体能否胜任真实岗位所需的多步骤、领域特定工作。在须满足全部专家撰写评分标准时,GPT-5.2 和 Claude Opus 4.6 等前沿模型解出不足 30% 的任务。利用该环境,我们用组相对策略优化(GRPO)和自适应裁剪训练 GLM 4.6。仅训练一个 epoch 后,模型在保留评估任务上的通过率从 25.37% 提升至 36.76%。更重要的是,这些收益迁移到分布外基准:BFCL Parallel +4.5%、Tau2-Bench Retail +7.4%、Tool Decathlon +6.8%(Pass@1)。我们认为三个环境特性与观察到的迁移一致:面向多样挑战任务的任务中心世界构建、支持可靠奖励计算的专家评分标准,以及反映真实职业模式的企业工作流。我们的结果表明,环境的质量、多样性与真实性是形成可泛化智能体能力的关键因素。