论文
重新思考世界动作建模的表示
Rethinking Representations for World-Action Modeling
摘要
世界动作模型共同学习机器人策略并预测未来的观察结果,使表示空间成为控制和预测之间的接口。我们通过受控比较研究了这个空间的设计,发现仅重建保真度和预训练的感知特征都不能确保有效的政策学习。这些发现激发了 ReWAM,这是一个基于预训练的 DINO 特征构建的以表示为中心的世界动作模型。特征校准和时间表示瓶颈将这些特征组织成适合动力学建模的紧凑世界状态。以行动为基础的表示塑造仅将行动损失梯度路由到瓶颈,从而让策略塑造表示编码的内容,同时世界模型学习它如何演变。在没有生成视频预训练的情况下,ReWAM 在 RoboTwin 2.0 上取得了 93.6% 的成功率。在 RoboDojo 上,使用大约 600 小时的具体预训练数据,它的平均得分为 12.29,成功率为 8.28%。