论文
OpenWAM:可组合世界动作模型的开放框架
OpenWAM: An Open Framework for Composable World-Action Models
摘要
世界动作模型把未来预测与机器人控制结合,但现有系统经常同时改变视频骨干、交互结构、监督和推理流程,难以比较设计。OPENWAM围绕共同因果机器人视频底座和可配置视频—动作交互构建开放框架。从Wan2.2-5B出发,以超过10,000小时视频进行因果机器人视频预训练,再通过共享Mixture-of-Transformers接入动作专家,支持联合、先视频后动作、先动作后视频和解耦生成。它在四套LIBERO与真实双臂任务达到较高成功率,因果适配的视频训练使VTA在LIBERO-Long由68.4%提高到97.8%。该架构也扩展到正、逆动力学,研究反事实转换能否超越纯示范监督。仅适配新任务视频预测器时,用反事实与示范训练的冻结局部上下文逆模型,在四个保留LIBERO-90任务平均成功率84.0%;全上下文逆模型47.0%,纯示范局部模型21.5%。正动力学中,反事实监督使RGB预测误差降低34.5%,16个相同起始状态的结果识别率从21.1%提高到71.3%。框架提供共同试验平台,用于比较交互设计及超越成功示范的视频动力学学习。
