论文

奖励作为具身世界模型的智能体

Reward as An Agent for Embodied World Models

模型训练奖励建模与过程监督

摘要

虽然RL已成为精炼世界模型的有前景工具——既有方法主要依赖训练分布附近的保守rollout——限制探索、行为多样性与更丰富的动态发现。本工作中——我们挑战该保守范式。我们主张核心局限不在探索本身——而在缺乏支撑更广探索的可靠验证策略。没有可靠验证——扩大的探索极易受奖励黑客影响——策略利用不完美奖励而无真正改进。为评估该动机——我们在具身世界模型中实例化我们的方法——物理合理性与任务完成为复杂动力学下可扩展RL提供严格试验台。在验证侧——我们介绍奖励即智能体——主动评估生成行为以提供鲁棒奖励信号、缓解分布偏移下奖励黑客的智能体奖励框架。在探索侧——我们经DynDiff-GRPO引入动态感知rollout多样化——显式扩展动作空间探索以多样化轨迹、拓宽状态-动作覆盖——并鼓励超越保守rollout机制的更丰富具身行为。通过统一奖励即智能体与DynDiff-GRPO——我们在更可靠的奖励基础上、以实质多样化的采样启用RL——有效缓解奖励黑客——同时在多个开源世界模型上取得显著准确率增益——从而表明:当扎根于鲁棒验证时——更广的探索可以成功扩展。

奖励作为具身世界模型的智能体:论文配图
图 2:奖励代理框架概述,该框架将规划、基于课程的奖励设计、投票和反思集成到统一的奖励生成管道中。