论文

WM-R1:通过强化学习训练GUI智能体进行推理并利用世界模型

WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

经过强化学习 (RL) 训练的 GUI 代理在移动平台上展示了​​强大的环境学习能力。然而,强化学习通常需要大量的真实环境交互,导致资源成本高且不稳定,尤其是在 GUI 场景中。为了解决这些问题,我们提出了 WM-R1,这是第一个用世界模型而不是真实环境来训练移动 GUI 代理的强化学习框架。具体来说,世界模型在所有部署过程中充当状态转换的来源,取代了训练循环中的真实 Android 环境。 WM-R1 还将世界模型直接嵌入到思维过程中,使智能体能够在采取最终行动之前推理候选行动的后果。至关重要的是,WM-R1 消除了对真实环境交互的需求,支持基于世界模型的大规模并行和步骤级粒度化轨迹生成,并引入了基于规则的多维奖励,共同优化任务成功、轨迹效率和世界模型利用率。为了高效训练,我们整理了包含 2000 个具有挑战性任务的高质量数据集。 Android 移动基准测试表明,经过 WM-R1 训练的代理显着优于仅 GRPO 基线和推理时间模拟方法。代码可在 https://github.com/genalyu/WM-R1 获取。

WM-R1:通过强化学习训练GUI智能体进行推理并利用世界模型:论文配图
图1:培训模式比较。左:标准GROPO通过实际环境相互作用产生轨迹,产生高计算成本、环境悬浮和不可逆转性。右: WM-R1 以世界模型取代环境,使轨道生成完全模拟。