论文
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型
DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation
摘要
移动操作要求机器人预测运动与手臂动作如何共同改变未来观测与控制。现有的世界-动作模型主要面向固定基座平台开发,并未显式区分相机自我运动与基座和手臂动作。在本文中,我们提出 DECOWAM,一个通过专用条件接口分离这些因素的全身世界-动作模型。DECOWAM 冻结一个适配过的 FastWAM 主干,并训练残差适配器、一个从特权观测蒸馏而来的动作等效未来瓶颈、对抗性分离的基座与手臂潜在表示,以及用于视频预测的基座速度条件化。我们还进一步推出 ARMDOG,一个同步视频、全身状态与动作以及语言的真实机器人数据集。在固定的重放协议下,DECOWAM 在未来视频和动作预测上都优于 FastWAM,仅用 25.95M 可训练适配参数就将动作 MSE 降低 21.7%。在每种方法 79 次闭环试验中,它在所比较系统中取得了观察到的最高全身协调性与基座位移鲁棒性,同时任务完成度与最强基线相当。这些结果表明,具身感知的因式分解可以在移动视角下支持参数高效的联合视觉预测与全身控制。
