论文

AWM-VLA:AlignedWorld 建模,实现高效且可解释的愿景-语言-行动政策

AWM-VLA: AlignedWorld Modeling for Efficient and Explainable Vision-Language-Action Policies

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型已经成为通用机器人操作的强大范例,但它们通常是反应性的:策略将当前观察直接映射到动作块,而不推理其决策的长期后果。之前为政策赋予世界模型的尝试要么在像素空间中重建未来的框架——成本高昂且以与任务无关的细节为主——要么将世界模型与政策脱钩,从而削弱控制。我们提出了 AWM-VLA,这是一个统一的框架,它将对齐的世界模型直接嵌入到扩散Transformer策略中。遵循未来潜在表示对齐(FLARE)原则,我们添加了可学习的未来词元,其中间激活与未来观察的视觉语言嵌入保持一致,使策略能够在生成行动的同时预测长期后果。我们通过两种方式扩展这个范式。首先,我们引入了一个以对象为中心的解耦对齐目标,它可以预测未来的对象级语义以及全局未来嵌入,从而提高可解释性和多指令泛化。其次,我们通过有原则的权重平衡全局和以对象为中心的对齐项与动作流匹配损失,从而产生可控的准确性-可解释性权衡。在 RoboCasa 和人形桌面操作基准上,AWM-VLA 的成功率比之前的 VLA 和世界模型基线高出 21%,提高了对新对象和指令的泛化能力,并在 83 种情况下产生了人类评估者更喜欢的以对象为中心的基本原理。我们的方法只在策略中添加了一些可学习的标记,并且与任何扩散或流量匹配策略兼容,使一致的世界建模成为通用操纵的廉价且广泛适用的组成部分。