论文

OpenWAM:可组合世界动作模型的开放框架

OpenWAM: An Open Framework for Composable World-Action Models

模型架构混合架构

摘要

世界动作模型把未来预测与机器人控制结合,但现有系统经常同时改变视频骨干、交互结构、监督和推理流程,难以比较设计。OPENWAM围绕共同因果机器人视频底座和可配置视频—动作交互构建开放框架。从Wan2.2-5B出发,以超过10,000小时视频进行因果机器人视频预训练,再通过共享Mixture-of-Transformers接入动作专家,支持联合、先视频后动作、先动作后视频和解耦生成。它在四套LIBERO与真实双臂任务达到较高成功率,因果适配的视频训练使VTA在LIBERO-Long由68.4%提高到97.8%。该架构也扩展到正、逆动力学,研究反事实转换能否超越纯示范监督。仅适配新任务视频预测器时,用反事实与示范训练的冻结局部上下文逆模型,在四个保留LIBERO-90任务平均成功率84.0%;全上下文逆模型47.0%,纯示范局部模型21.5%。正动力学中,反事实监督使RGB预测误差降低34.5%,16个相同起始状态的结果识别率从21.1%提高到71.3%。框架提供共同试验平台,用于比较交互设计及超越成功示范的视频动力学学习。

OpenWAM:可组合世界动作模型的开放框架:论文原图
图1:OpenWAM总览。左:从Wan2.2[75]出发,在机器人与人类交互视频上因果预训练,无动作标签地构建预测底座,再用仿真及实机示范训练视频—动作。右上:共享Mixture-of-Transformers通过联合注意力连接时间对齐的视频与动作流,保留各模态专家。右中:同架构以跨模态注意和生成顺序支持联合、先视频后动作、先动作后视频与解耦预测。右下:示范及反事实转换独立训练局部上下文正逆动力学;冻结IDM把兼容任务适配视频模型的预测转为动作,FDM预测候选动作的视觉后果。