论文
PROWL:世界模型学习的优先后悔驱动优化
PROWL: Prioritized Regret-Driven Optimization for World Model Learning
摘要
现代动作条件视频世界模型实现了强大的短视视觉现实主义,但在主导下游规划和政策绩效的罕见的、交互关键的转变上仍然不可靠。由于被动演示数据系统地对这些高影响力的情况进行了欠采样,因此提高稳健性需要主动引发模型故障,而不是依赖其自然发生。我们引入了 KL 约束的对抗性课程,其中训练策略以暴露基于扩散的世界模型的高错误轨迹,同时保持接近行为分布。世界模型在这些对抗性发现的轨迹上不断进行微调,产生一个对抗性训练循环,将罕见的故障转换为稳定的、接近分布的训练信号,而不会陷入分布外的利用。为了在模型改进时保持对未解决的弱点的压力,我们提出了一个优先化对抗轨迹(PAT)缓冲区,它根据预测误差、动作保真度和学习进度对轨迹进行重新排序,将训练重点放在未解决的故障模式上,而不是反复重新审视已解决的案例。我们在 MineRL 框架中实施我们的方法,并根据保留的分布外轨迹对其进行评估; PROWL 提高了仅使用被动数据训练的模型的鲁棒性,揭示了弱行为约束下的 奖励作弊 行为,并证明有效的对抗世界 - 模型训练 关键取决于平衡探索性故障发现与显式行为正则化。我们的结果表明,可扩展的世界模型不仅受益于更大的数据集,还受益于有选择地生成信息丰富的训练数据。