论文

Agent-World:面向通用智能体进化扩展真实世界环境合成

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

模型训练强化学习Agentic RL

摘要

大语言模型日益被期望充当与外部有状态工具环境交互的通用智能体。模型上下文协议(MCP)与更广泛的智能体技能为连接智能体与可扩展的真实世界服务提供了统一接口,但训练鲁棒的智能体仍受限于真实环境的缺失与终身学习原则性机制的缺乏。本文提出 Agent-World,一个通过可扩展环境推动通用智能体智能发展的自我进化训练场。Agent-World 有两个主要组件:(1)智能体环境-任务发现,从数千个真实世界环境主题中自主探索主题相关的数据库与可执行工具生态,并合成难度可控的可验证任务;(2)持续自我进化智能体训练,将多环境强化学习与自我进化智能体竞技场相结合,通过动态任务合成自动识别能力缺口并驱动针对性学习,实现智能体策略与环境的共同进化。在 23 个具有挑战性的智能体基准上,Agent-World-8B 与 14B 持续超越强大的专有模型与环境扩展基线。进一步分析揭示了与环境多样性及自我进化轮次相关的扩展趋势,为构建通用智能体智能提供了洞见。

Agent-World:面向通用智能体进化扩展真实世界环境合成:论文配图
图1:左为Agent-World总览,右为下游通用Agent性能:MCP-Mark、BFCL V4、τ²-Bench子域平均得分。