论文

Discrete-WAM:用于世界政策学习的统一离散视觉行动词元编辑

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

模型训练预训练

摘要

自动驾驶需要推理自我行为如何塑造未来世界的演变,而不仅仅是将观察映射到行动。然而,大多数端到端方法依赖于直接的状态到行动模仿,而现有的世界模型往往与下游政策生成的一致性较差。我们引入 Discrete-WAM,这是一个统一的离散视觉行动世界政策框架,它代表共享词元空间内的视觉观察、未来状态、高层决策和自我行动。建立在这种离散对齐的基础上,Discrete-WAM 通过多任务和多阶段预训练联合训练世界建模、世界政策建模和政策建模,从而允许以行动为条件的未来预测直接支持政策生成。对于下游规划,Discrete-WAM 进一步将策略生成分解为分层决策预测和并行操作词元编辑,其中决策词元提供高级规划框架,而基于置信度的调度有效地细化密集的未来操作。大规模自动驾驶基准测试表明,Discrete-WAM 实现了强大的规划性能,同时支持可控的未来生成、反事实评估、基于意外的世界模型分析和高效的并行策略解码。这些结果表明,离散表示对齐、统一的世界策略训练和分层词元编辑为物理人工智能提供了有前途的设计范例。