论文

GigaWorld-Policy-0.5:由 AutoResearch 提供支持的更快更强的 WAM

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

摘要

世界动作模型(WAM)通过联合建模动作和未来视觉观察来改进机器人策略学习,使用未来场景演化作为符合物理规律的动作生成的密集监督。然而,现有 WAM 的常见设计是在推理时显式生成未来视频,这会产生大量计算开销并阻碍实时闭环部署。 GigaWorld-Policy 通过以动作为中心的公式解决了这个问题,其中在训练期间使用未来的视觉动态,而在推理时使用仅动作解码。在此框架的基础上,我们推出了 GigaWorld-Policy-0.5,这是一种增强的以动作为中心的 WAM,旨在实现更高效的机器人控制。在预训练过程中,GigaWorld-Policy-0.5采用混合动作条件世界建模(AC-WM)和WAM训练策略。这加强了视觉动力学和机器人动作之间的耦合,并提高了下游策略学习的动作表示的可转移性。为了实现高效推理,GigaWorld-Policy-0.5 引入了 Mixture-of-Transformer 架构,将视觉动态建模和动作生成分离给专门的专家,减少仅动作推理期间的主动计算,并在本地 RTX 4090 设置上实现 85 毫秒的推理延迟。此外,我们采用基于代理的自动研究管道来系统地搜索训练配置,从而能够更有效地识别最佳实验设置,同时减少超参数调整所需的时间和手动干预。实验和消融表明,GigaWorld-Policy-0.5 保留了未来视觉动态的训练优势,同时提高了机器人控制的推理效率。