论文

FutureWorlds:从替代未来中学习机器人世界模型

FutureWorlds: Learning Robotic World Models from Alternative Futures

模型训练强化学习

摘要

机器人世界模型预测以动作为条件的未来场景,为理解动作结果提供基础。然而,将替代预测转化为有用的学习信号仍然具有挑战性:相似的候选者限制了信息质量的比较,而不同的轨迹需要持续维护其各自的历史。我们引入了 FutureWorlds,这是一个统一候选构建、历史维护和相对质量学习的框架。 FutureWorlds 基于多模态离散自回归模型构建,在强化学习期间使用多样化束搜索来构建平衡置信度和多样性的候选未来。特定于候选者的有界内存保留场景状态,并确保生成和策略评分使用匹配的历史记录。我们进一步提出MemSPO(内存条件搜索引导策略优化),它将视频轨迹奖励转化为群体相对优势,以优化世界模型。在 RT-1、BridgeV2 和 RoboCasa 上,相对于每个数据集的最强基线,FutureWorlds 将 32 帧预测的 LPIPS 分别降低了 14.78%、20.84% 和 9.12%。在固定评估配置下,只需 200 个 MemSPO 更新即可进一步提高生成质量并支持超出训练范围的持续预测。内存消融、解码灵敏度分析和光流评估表明,这些增益不仅限于视觉质量,还包括更准确的运动预测和更一致的物体状态。项目页面和代码:https://github.com/Alexander-wu/FutureWorlds.