论文
AHA-WAM:具有观察引导上下文路由的异步水平自适应世界动作建模
AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
摘要
世界动作模型已成为机器人操纵的一个有前途的范例,联合建模视觉场景动态和动作,将物理先验注入策略学习中。然而,现有的世界动作模型以相同的时间分辨率将世界预测和动作执行结合起来,迫使世界分支对冗余且信息量较弱的近期帧变化进行建模。我们认为,将世界预测和动作执行严格绑定到相同的时间节奏可能无法充分利用视频分支的具体控制潜力。因此,我们提出了 AHA-WAM,一种基于双扩散 Transformer (DiT) 架构的异步地平线自适应世界动作模型,围绕这种时间不对称性重新组织世界动作模型。 AHA-WAM 将视频 DiT 实例化为低频世界规划器,在过去的观察中保持滚动键值记忆,并公开可重用的分层潜在上下文编码长视野场景演化,而高频动作 DiT 通过分层联合注意力查询此上下文,在闭环中执行短动作块。为了支持异步执行,我们引入了水平自适应偏移训练和观察引导视频上下文路由(OVCR),它们共同让动作专家利用长水平世界上下文,同时保持对实时执行状态的响应,而无需重新运行视频 DiT。 RoboTwin 和现实世界操作任务的实验表明,AHA-WAM 在没有任何机器人数据预训练的情况下实现了最先进的性能,在 RoboTwin 上获得了 92.80% 的平均成功率,在 4 个现实世界任务中获得了 78.3% 的成功率,同时达到了 24.17 Hz 闭环控制,速度比 Fast-WAM 提高了 4.59 倍。