论文

GigaWorld-1:构建机器人策略评估世界模型的路线图

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

模型评测基准与评测资源

摘要

评估实体机器人基础模型仍然是一个关键瓶颈;与通过数字基准进行有效评估的 大语言模型 不同,机器人策略需要在现实世界中缓慢、昂贵地轨迹执行,受到硬件和人工监督的限制,这引发了人们对世界模型作为替代策略评估者的兴趣,但使世界模型可靠用于策略评估的关键属性仍然知之甚少。这项工作提出了对机器人策略评估的世界模型的系统研究,并介绍了 WMBench,这是一个由真实机器人远程操作数据和涵盖不同操作任务的匹配策略轨迹执行构建的基准,以实现模型系列、动作编码、轨迹执行范围和评估指标之间的受控比较。使用 WMBench,我们分析了 7 个视频世界模型、4 个动作表示方案以及超过 324,000 个与真实机器人执行相结合的模拟策略轨迹执行,通过 CVPR 2026 GigaBrain Challenge 的大规模社区提交、精心策划的合成轨迹以及跨越 12,000 多个小时的训练视频,进一步丰富了我们的分析。我们的实验提供了三个核心见解:评估者的质量取决于长期、忠实于行动的轨迹执行一致性,而不是短期的视觉现实主义;预训练收益不仅源于数据规模,还源于平衡一般世界知识与机器人特定的可控性;包括动作编码、内存设计和以评估器为中心的 后训练 等架构选择在很大程度上决定了与现实世界机器人行为的一致性。借鉴这些结果,我们得出了实用的设计路线图,并在专门针对策略评估优化的世界模型 \textit{GigaWorld-1} 中实现,并全面发布我们的代码、模型、数据集和工具包,以推进具体基础模型的可扩展评估研究。