论文
PWM:具有在线强化学习的个性化世界模型
PWM: Personalized World Models with Online Reinforcement Learning
摘要
预训练的世界模型可以生成不同的环境,但用户通常希望探索自己的视频指定的特定场景。这需要学习场景的视觉特性,同时保留动作条件生成的质量。我们介绍个性化世界模型(PWM),这是一个通过在线强化学习从短场景视频定制交互式世界模型的框架。在 PWM 中,支持轨迹及其相关控件提供对从当前策略采样的连续性的奖励反馈。在 GRPO 实例化中,组相关优化使用场景外观、视觉连续性和运动的统一奖励来更新紧凑的 LoRA 适配器,而基础策略锚定则规范了对冻结 Yume-5B 骨干模型之前的预训练生成的更改。相同的适应过程适用于真实和渲染的环境。我们还使用 DiffusionNFT 实例化 PWM,作为学习特定场景适配器的替代奖励引导优化方法。我们还推出了 PWM-Bench,其中包括室内、室外和游戏领域的 150 个定制任务,以及对留出延续的配对评估。 PWM 的 GRPO 和 DiffusionNFT 实例分别在 71.3% 和 65.3% 的评估场景中比原生 Yume 提高了定制性,在所有三个领域中均具有正的平均增益。对于 GRPO 实例化,匹配的 SFT 比较进一步证明了每个领域中更高的平均定制增益和更好的平均图像质量分数,同时保持接近预训练模型的帧级视觉质量。
