论文
PAVXploreRL:带有动作探索的物理-动作-视觉世界模型强化学习
PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration
摘要
以行动为条件的世界模型是具体人工智能的关键组成部分,可作为可扩展的政策评估器,减少对昂贵的真实世界执行轨迹的依赖。为了准确捕捉不同的动作引起的动态,此类模型应满足三个关键目标——物理合理性 (P)、动作依从性 (A) 和视觉保真度 (V)(统称为 PAV),同时对分布内 (ID) 专家演示和分布外 (OOD) 动作保持鲁棒性。然而,现有方法主要依赖于 ID 动作视频对和像素级重建损失,这些方法没有明确优化 PAV 目标,并且在专家数据之外的泛化能力很差。为了解决这个问题,我们提出了 PAVXploreRL,这是一种基于预训练潜在世界模型的强化学习框架,可通过奖励驱动的训练显式优化 PAV 目标。为了提高动作泛化,我们的方法联合利用 ID 轨迹和噪声驱动的 OOD 动作探索,无需配对视频监督。实验表明,PAVXploreRL 始终优于预训练基线,在基准测试中实现 5.6% 的平均增益,并产生更高质量的 PAV 属性。作为策略评估器,它还可以产生更可靠的性能估计,并减少先前仅专家世界模型(例如 Ctrl-World)的高估偏差。代码:https://github.com/Social-AI-Studio/PAVXploreRL