论文
StressDream:引导视频世界模型进行稳健的政策评估和改进
StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement
摘要
视频世界模型(WM)通过想象以自我机器人行为为条件的现实未来观察,显示出政策评估和改进的前景。虽然 WM 可以对未来的分布进行建模,但政策评估和改进通常依赖于名义想象力,除非抽取大量样本,否则可能会错过机器人行动的高影响力结果。为了实现稳健的政策评估和改进 WM 想象力,我们提出了 StressDream,它通过优化基于扩散的 WM 的初始噪声,将想象力引导到推理时指定的高影响力但合理的结果。然而,优化高维噪声具有挑战性:优化必须推理生成视频中细微的、与场景相关的目标事件,同时避免产生难以置信的想象力的分布外 (OOD) 噪声。我们通过两个互补的目标来解决这个问题:带有视觉语言模型的语义目标,通过推理生成的视频提供信息梯度,以及防止优化噪声漂移 OOD 的合理性目标。借助用于自动驾驶和机器人操作的最先进的视频世界模型,我们表明,StressDream 可以有效地将想象力引导到推理时文本指定的高影响力但合理的结果(例如任务失败),通过识别可能的未来包括不良结果的行动,实现稳健的政策评估和改进。视频结果可在 https://junwon.me/StressDream/ 获取。