论文

EWAM:用联合注意力连接语义理解、未来预测与动作

EWAM: Emergent Depth-Wise Specialization in a Unified Embodied Model -- From Semantic Understanding through Visual Foresight to Action

模型架构Transformer

摘要

视觉-语言-动作(VLA)策略强调语义理解,而世界动作模型(WAM)学习环境动态的预测表示。将策略暴露给两个来源的系统通常仍然将动作计算集中在单个专家身上。我们提出了 EWAM,一种以动作为中心的统一体现模型,其不对称联合注意力让动作标记读取每一层的语义、当前视觉、预测未来和动作信息,同时感知专家保留其独特的角色。在没有分层监督的情况下,EWAM 开发了一种新兴的深度专业化:动作查询主要关注浅层中的视觉语言特征,预测中间层中的未来帧,以及深层中的动作标记本身。这种切换在任务之间复制,并且在去噪步骤之间保持稳定。检查点跟踪和因果干预表明它是习得的,并且行动的产生依赖于它。 EWAM 在两种不同的机制中进行预训练,一种是跨实体机器人轨迹,另一种是人类自我中心视频。在模拟和真实机器人实验中,它超越了现有的 VLA、WAM 和混合基线。人类以自我为中心的数据提高了跨实体传输和真实机器人的鲁棒性,子任务阶段的监督提高了长期完成度。总之,这些结果表明,统一的具身学习可以诱导从语义理解到视觉预见再到行动形成的有序内部进展。