论文
EnvACE:通过世界预演内化Agentic强化学习的环境动态
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
摘要
使用大语言模型代理进行长期工具使用通常依赖于与真实或合成可执行环境的交互,其构建和验证成本高昂,或者依赖于难以锚定的外部模拟器。我们引入了EnvACE,这是一种替代外部环境互动的agentic强化学习方法,通过世界练习来代替。策略在交替执行和练习之间切换:首先生成工具调用,然后扮演环境的角色,以该动作引起的响应为基础,条件后续决策。两个角色都使用任务成功奖励进行联合优化。通过世界练习,策略将其参数内化为行动与环境响应之间的关系,从而产生一个直接支持决策的环境模型。在BFCL-v4、tau^2-Bench、VitaBench和FinMCP-Bench上,EnvACE表现出强大的且可转移的表现,超越了整体评估中的环境扩展基线。进一步的控制性研究还表明,世界练习在模型规模上持续改善策略学习。在测试时间,内化的环境模型允许在执行前进行私人的练习,从而在适度的练习预算下取得额外收益,而无需额外的外部交互。我们的发现确立了世界练习作为超越外部环境限制的新路径来扩展大语言模型代理训练。我们的代码可在https://github.com/Within-yao/EnvACE处公开获取。
