论文
MT-WAM:将一次性预测表示重新定位为行动生成
MT-WAM: Reorienting the One-Pass Predictive Representation Toward Action Generation
摘要
Fast-WAM 表明,视频动作协同训练可以改善控制,而无需在推理时生成未来视频,从而使单个视频扩散 Transformer 的表示成为动作生成的中心。然而,未来观察预测并没有明确优先考虑控制所需的未来动态和视觉结构。我们提出了 MT-WAM,它保留了原来的训练目标,并增加了对未来二维点轨迹和视觉特征的补充监督。从视频主干的最终块复制的轻量级双流分支提供特定于目标的处理,而结构化注意掩模可防止跨流注意。运动流词元为动作专家提供额外的动态条件。未来的视觉特征预测提供了捕获对象和空间结构的特征空间中的监督。这种监督训练视频骨干网,在不断变化的视觉条件下为动作生成提供更多信息的视觉上下文,而无需在动作调节中添加视觉特征流标记。在推理时,MT-WAM 使用每次重新计划计算一次的视频和运动缓存,并跳过未来视频预测。在没有额外的具体策略预训练的情况下,MT-WAM 在 LIBERO 上取得了 98.2% 的成功率,在 LIBERO-Plus 上取得了 73.7% 的成功率,比后者高出 Fast-WAM 23.8 个百分点。在 RoboTwin 2.0 Clean2Rand 上,随机成功率从 6.30% 增加到 19.40%;在四项现实世界任务中,平均成功率从 67.0% 增加到 77.8%。