论文
WAM-RL:具有重建奖励和在线视频 SFT 的世界行动模型强化学习
WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT
摘要
最近的世界行动(WA)模型表现出强大的泛化能力和数据效率,但它们通常依赖于专家轨迹进行训练。这种依赖限制了他们获得演示分布之外的细粒度操作技能的能力,并阻止他们通过现实世界的交互不断改进。为了解决这些限制,我们提出了 WAM-RL,这是一种强化学习框架,可以通过与环境的在线交互来联合优化世界模型和动作模型。通过允许两个组件共同进化,我们的方法增强了细粒度的控制和适应性。具体来说,WA模型由世界模型和策略网络组成。我们设计了一种具有分层优化的定制强化学习方法来协调它们的改进。在方法论方面,我们系统地研究了将强化学习应用于动作模型的效果,以及在强化学习环境中对世界模型进行在线训练的效果。我们的实验揭示了一个关键的见解:仅优化参与者可以在短期任务上带来改进,但无法在长期任务上提供显着的收益。相比之下,联合优化世界模型和策略网络对于在长期环境中实现出色的性能至关重要。我们的工作是第一个将强化学习引入世界行动范式的工作,并提供了关于行动头和世界模型的在线优化如何影响整体性能的见解。