论文
重新连接语义、动力学和控制:一个简单而有效的以动作为中心的三流Transformer
Rewiring Semantics, Dynamics, and Control: A Simple yet Effective Action-Centric Tri-Stream Transformer
摘要
视觉语言动作 (VLA) 模型已成为复杂机器人操作的重要框架,它建立在对预训练视觉语言模型 (VLM) 的强大语义理解之上。然而,此类 VLM 主干网提供的物理动力学先验不足,限制了机器人策略的泛化能力。因此,最近的努力通过各种策略将视频生成世界模型(WM)集成到机器人策略中,使用预测动力学来促进动作生成。尽管取得了这些进展,利用语义理解和动态预测作为动作生成的补充指导仍然具有挑战性。在本文中,我们介绍了 $\mathrm{ACT}^3$,一个简单而有效的以动作为中心的三流Transformer,它将语义和动态信息融合到控制动作中,同时保留上下文流的不同角色。具体来说,$\mathrm{ACT}^3$ 使专门的动作专家能够通过分层注意力访问 VLM 和 WM 表示,每个骨干仅在自身信息流内计算注意力。这 简单的交互设计在上下文流中保持独立的前向传播,同时允许通过控制监督更新两个骨干网。模拟和现实世界机器人操作基准的实验表明,所提出的 $\mathrm{ACT}^3$ 产生的结果优于其对应的结果。