论文

Pelican-Sim 1.0:体现智能的通用世界模型模拟器

Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence

模型架构新型架构

摘要

在这份技术报告中,我们提出了 Pelican-Sim 1.0,这是一种用于体现智能的通用世界模型模拟器,可以根据视觉上下文和机器人动作预测未来的观察结果,以支持下游学习和决策。该模型包含四个关键设计特征:(1)统一动作表示:覆盖大多数主流实施例的28维动作值空间,保持一个模型在异构设备上有效。 (2) 动作视觉注入:URDF 和摄像机渲染的动作视频桥接动作和像素,在实施例、场景和任务之间提供明显更好的可控性(相对于替代融合基线,PSNR +0.904)。 (3) 稀疏专家混合 (MoE):稀疏 MoE 层增加了异质动力学的能力并吸收了动作模态,同时减少了模态间冲突(FVD -6.530 与密集主干相比)。 (4) 高效的 rollout 生成:因果适应和少步蒸馏产生了四步自回归模拟器,比 35 步模型实现了 5.67 倍的加速。受益于这些设计,我们在大约一百万个真实世界和模拟轨迹上进行训练,并在动作可控性和视频质量方面获得了巨大的进步:PSNR 在 AgiBotWorld Beta 上比最强评估基线提高了 4.636,在 RoboMIND 上提高了 2.080,在 RoboTwin 上提高了 10.343,在 RoboTwin 上调整后的 EWMBench DYN 得分提高了 0.426。依靠这一点,RoboTwin 上的四个下游应用程序取得了成功:每个任务添加 500 个生成轨迹到 50 个演示,将策略成功率从 70% 提高到 93%;政策评估在五个检查点的皮尔逊相关性达到 0.994;行动选择的相对成功率达到 47.7%,政策改进的相对成功率达到 20.3%。轨迹、场景、对象、实施例和视角转换的定性概括凸显了其作为通用世界模型模拟器的潜力。