论文

Light-WAM:具有状态融合动作解码的高效世界动作模型

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

模型优化小模型/轻量模型

摘要

世界行动模型(WAM)通过将未来预测作为额外的训练目标来扩展机器人策略学习,鼓励策略在其表示中编码与任务相关的时间结构。当前的WAM通常依赖于大规模的生成架构,这会产生高昂的训练成本和推理延迟,使得它们难以部署为高效的闭环策略。我们提出了 Light-WAM,一种用于高效机器人操作的轻量级世界动作模型。具体来说,它采用紧凑的视频主干构建,并在下采样的潜在空间中执行未来视频监督,降低了视频协同训练的成本,同时保留了表示学习的优势。对于动作预测,Light-WAM 引入了 StateFusionActionExpert,它从多个骨干层读取适应状态,通过学习查询池融合它们,并在单个前向传递中直接预测动作块。这种设计在视频骨干表示和机器人动作之间提供了一个有效的接口,避免了对繁重的生成动作专家的需求。实验表明,Light-WAM 在 LIBERO 上保持了强大的性能,并在 RoboTwin 2.0 上实现了可用的多任务性能,同时仅使用 0.44B 可训练参数。它还通过 4.1GiB 峰值 GPU 内存实现了 72.03 毫秒的推理延迟,并提高了训练吞吐量。