论文

Youtu-Agent:以自动化生成与混合策略优化扩展 Agent 生产力

Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization

智能体系统模型训练上下文与知识强化学习上下文工程Agent 架构与控制循环Agentic RL

摘要

现有大语言模型(LLM)智能体框架面临两大突出挑战:配置成本高与能力静态。构建高质量 Agent 往往需要在工具集成与提示工程上投入大量人工,而已部署的 Agent 在没有昂贵微调的情况下难以适应动态环境。为解决这些问题,我们提出 Youtu-Agent,一个为 LLM 智能体自动化生成与持续演进设计的模块化框架。Youtu-Agent 的特色是结构化配置系统,将执行环境、工具包与上下文管理解耦,实现灵活复用与自动合成。我们引入两种生成范式:面向标准任务的 Workflow 模式,以及面向复杂、非标准需求的 Meta-Agent 模式,后者能够自动生成工具代码、提示与配置。此外,Youtu-Agent 建立了混合策略优化系统:(1) Agent Practice 模块,使 Agent 无需参数更新、通过上下文内优化积累经验并提升性能;(2) Agent RL 模块,与分布式训练框架集成,使任意 Youtu-Agent 能以端到端、大规模方式进行可扩展且稳定的强化学习。实验表明,Youtu-Agent 使用开放权重模型在 WebWalkerQA(71.47%)和 GAIA(72.8%)上取得最先进性能。其自动化生成管线的工具合成成功率超过 81%,Practice 模块在 AIME 2024/2025 上分别提升 2.7% 和 5.4%。此外,Agent RL 训练在 7B LLM 上取得 40% 提速且性能稳步提升,在数学与通用/多跳问答基准上分别将编码/推理与检索能力最多提升 35% 和 21%。

Youtu-Agent:以自动化生成与混合策略优化扩展 Agent 生产力 配图
图 1:自动生成机制。左:描述所需智能体的用户输入。中:两种生成范式——Workflow 模式(上)遵循确定性的四阶段流水线,而 Meta-Agent 模式(下)部署一个拥有灵活工具访问权限的 architect 智能体。右:生成完毕、随时可部署的智能体配置。