论文
MiniWAM:学习高效世界动作建模的紧凑未来目标
MiniWAM: Learning Compact Future Targets for Efficient World-Action Modeling
摘要
世界建模已成为机器人政策的有效协同训练目标,从而催生了共同预测行动和未来状态的世界行动模型(WAM)。然而,大多数 WAM 预测预训练视觉主干的本机表示空间中的未来状态,从而产生需要大量训练成本的高维目标。我们引入了 MiniWAM,它预测从优先的当前-未来转换中学习到的紧凑的未来表示。为了构建这些目标,我们提出了通过逆时空建模(PRISM)的预测表示,它将逆动态监督与特征重建相结合,以强调与控制相关的转换信息,同时保留有用的未来状态信息。随着学习到的 PRISM 编码器被冻结,MiniWAM 被训练来根据当前观察结果联合预测目标和机器人动作。由于本机未来功能token减少了 65$\times$,MiniWAM 在 DINOv3 和 WAN2.1 VAE 功能方面始终优于本机未来功能预测,同时实现了高达 世界行动训练加速 8$\times$。在 0.25B 参数下,MiniWAM 在 LIBERO、LIBERO-Plus 和 RoboTwin 2.0 模拟基准测试中已经可以与更大的 WAM 竞争。表示分析进一步表明,PRISM 对行为结构的贡献超出了单独的特征重建的范围。这些结果表明,有效的世界行动建模不需要预测本地视觉未来,并且紧凑的预测表示为政策学习提供了强大且更有效的目标。项目页面位于:https://j1dan.github.io/MiniWAM.