论文
ReWorld:世界行动模型的表征学习
ReWorld: Representation Learning for World Action Models
摘要
世界行动模型 (WAM) 将未来环境预测与自动驾驶的行动生成统一起来,但现有方法仅优化最终输出,而将中间表示作为附带的副产品。我们推出了 ReWorld,这是第一个专为自动驾驶 WAM 设计的表示学习框架。 ReWorld 通过三种互补机制明确优化潜在的世界到行动路径。首先,它对中间 Video DiT 状态施加未来预测监督,以对时间场景动态进行编码,从而实现自引导采样和大约两倍的收敛加速。其次,它将 Action DiT 状态与其参与的视频读出保持一致,以便检索到的世界信息保留在用于规划的表示中。第三,它使用几何上接近但低分的硬负例来塑造动作空间,以将专家轨迹与附近不安全的替代方案分开。 ReWorld 完全根据 WAM 自己的生成目标和参与特征构建监督,不需要外部编码器或教师模型,并且仅引入 0.3% 的额外每步训练成本。实验表明,ReWorld 在 nuScenes 上将 FVD 从 81.3 降低到 61.9,在 NAVSIM 上将闭环 PDMS 从 89.1 提高到 90.4,无需强化学习或测试时间评分,并将 UCF-101 动作识别上的冻结线性探针准确度从 68.3% 提高到 80.2%。这些结果表明,显式优化的表示对于将世界知识转化为 WAM 的规划能力至关重要。