论文

FLEX-WAM:用于长期想象力和规划的灵活的块因果世界行动模型

FLEX-WAM: Flexible Block-Causal World-Action Models for Long-Horizon Imagination and Planning

模型架构混合架构

摘要

世界行动模型(WAM)承诺提供一个统一的模型,可以预测以行动为条件的未来,生成可行的行动,并支持想象中的规划。然而,现有的联合视频动作模型通常使用计算量大的固定视野骨干模型,不适合流式推理和稳定的长视野开环执行轨迹。我们介绍 FLEX-WAM,一个灵活高效的块因果世界——用于统一模拟和策略推理的动作模型。 FLEX-WAM 支持可变长度上下文和非因果预测范围,以及逐帧或逐块的无限自回归生成。其块因果、KV 可缓存架构结合了轴向注意力和块扩散强制,以实现高效的实时执行轨迹和部署时延迟 - 无需重新训练的吞吐量权衡。尽管如此,联合训练仍然可以产生对命令行动反应较弱的合理未来。我们通过平衡状态和动作流匹配梯度在状态-动作扩散噪声网格中的贡献来解决这种故障模式,并使用前向动力学(FD)弹性(动作响应性的有效训练时间代理)调节世界模型采样。在模拟和现实世界数据集中,FLEX-WAM 实现了卓越的多步预测质量和延迟,同时生成数千步的稳定联合状态动作执行轨迹。作为 MCTS 内的联合动作提议器和模拟器,它完全在想象中解决了长期 PushT 和所有五个 OGBench Puzzle-4x4 任务。在基于 OpenArm 的双手机器人上,单个检查点共同充当游戏策略和预期结果预测器,从而能够实时识别和收集模型与现实的不匹配情况,以供未来的自我改进。