论文
EnvRL:从代理强化学习中的环境动态中学习
EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
摘要
强化学习 (RL) 已成为训练 大语言模型 (LLM) 作为代理的强大范例。然而,用于长期代理任务的传统强化学习方法往往难以获得稀疏的结果奖励。直观上,这忽略了采样交互轨迹中包含的丰富的环境动态信息。我们认为,交互体验本质上是一种隐式监督信号,揭示了环境的潜在转换机制,并使代理能够构建更准确的环境内部模型。因此,在这项工作中,我们研究如何利用这种附加信号来改进策略学习。具体来说,我们提出了 EnvRL,这是一个框架,通过两个辅助目标:状态预测和逆动力学,将环境动态学习融入到代理强化学习中。通过与主要强化学习目标联合优化,我们鼓励智能体从自己的交互体验中内化环境动态。对两个长期代理基准的广泛实验表明,与仅 RL 的基线相比,EnvRL 在成功率上取得了显着提高,例如,当使用 GRPO 进行训练时,将 Qwen-2.5-1.5B-Instruct 在 ALFWorld 上从 72.8% 提升到 77.4%,在 WebShop 上从 56.8% 提升到 67.0%。