论文
Riemann-1.0:物理人工智能的具体世界行动模型
Riemann-1.0: An Embodied World Action Model for Physical AI
摘要
我们引入 Riemann-1.0,一种用于体现智能的完全因果自回归世界行动模型。 Riemann-1.0 在统一的因果自回归序列中联合建模多视图视觉观察、机器人状态和特定于实施例的动作,将机器人动作和世界演化表示为因果状态转换。与基于联合生成、视频优先预测或解耦建模范式的现有 WAM 不同,Riemann-1.0 将在线机器人策略执行和动作条件世界模拟统一在单个模型中,使其能够充当可执行机器人策略和多实施例视觉世界模拟器。为了扩展跨异构数据源的具体体验,我们进一步开发了一个渐进的具体预训练框架,该框架在共享的世界动作建模目标下统一了以自我为中心的人类视频、手持式抓手演示和异构机器人轨迹的学习。 Riemann-1.0 基于超过 20 万小时的交互数据,逐步将大规模的具体经验转化为可执行的机器人操作能力。 Riemann-1.0 在模拟基准测试和现实操作任务中均实现了最先进的性能。它在 RoboTwin2.0 上实现了 94.3%,在 LIBERO 上实现了 99.0%,在长视野组合基准 RoboCasa-365 上实现了 62.6% 的成功率,比之前的最佳方法高出 8.4%。在长视野现实世界操作任务上,Riemann-1.0 实现了 85.0% 的成功率(SR)和 85.0% 的进度成功率(PSR) 94.4%,比 SR 中最强的开源基线高出 15%。这些结果表明,统一的世界动作建模与渐进的具体预训练一起有效地将大规模的具体经验转化为可推广的机器人操纵能力。