论文

Agent World Model:面向Agentic强化学习的无限合成环境

Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning

模型训练强化学习合成数据Agentic RL

摘要

大语言模型 (LLM) 的最新进展使自主代理能够执行需要与工具和环境进行多轮交互的复杂任务。然而,由于缺乏多样化和可靠的环境,扩展此类代理训练受到限制。在本文中,我们提出了代理世界模型(AWM),一个完全合成的环境生成管道。使用此管道,我们可以扩展到涵盖日常场景的 1,000 个环境,其中代理可以与丰富的工具集(平均每个环境 35 个工具)进行交互并获得高质量的观察结果。值得注意的是,这些环境是代码驱动的,并由数据库支持,提供比大语言模型模拟的环境更可靠、更一致的状态转换。此外,与从现实环境中收集轨迹相比,它们可以实现更有效的代理交互。为了证明该资源的有效性,我们对多轮工具使用代理进行大规模强化学习。得益于完全可执行的环境和可访问的数据库状态,我们还可以设计可靠的奖励函数。对三个基准的实验表明,仅在合成环境中进行训练,而不是在特定于基准的环境中进行训练,可以产生强大的分布外泛化能力。该代码可在 https://github.com/Snowflake-Labs/agent-world-model 获取。

Agent World Model:面向Agentic强化学习的无限合成环境
图1:Agent World Model(AWM)是一个合成环境生成流水线,可合成1,000个带数据库的多样化代码驱动agentic环境,用于训练工具使用agent。