论文

小米-机器人-U0:与世界基础模型的统一体现综合

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

模型训练预训练

摘要

最近的基础图像和视频生成模型提供了很强的泛化性和可控性,但它们在具体场景中的直接应用受到多视图一致性、几何相干性和机器人具体约束的要求的限制。现有方法通常使用有限的机器人数据来适应基础模型,通常会牺牲在大规模 预训练 期间获得的视觉知识。我们推出了Xiaomi-Robotics-U0,这是一个用于统一具体综合的 380 亿参数多模态自回归模型。它将具体化生成视为基础图像和视频生成的扩展,并联合优化文本到图像生成、图像编辑、具体化场景生成、具体化传输和具体化视频生成。这个统一的框架保留了预先训练的世界基础模型的泛化性,同时使其适应具体的设置。小米机器人-U0是第一个支持跨多个机器人实施例的高质量多视图场景生成的模型,并引入结构化、可控的实施传输以进行细粒度编辑,同时保持多视图一致性和交互动态。它在单步和顺序生成任务上取得了最先进的结果,在具体场景生成和传输的人类评估中优于 GPT-Image-2.0,在具体视频生成的 World Arena 上排名第一,并将 pi_0.5 在具有挑战性的现实世界操作任务上的分布外成功率从 36.9% 提高到 63.2%。这些结果表明,基础世界模型既可以作为具体世界模型,也可以作为具体智能的可扩展数据引擎。代码和检查点可在 https://robotics.xiaomi.com/xiaomi-robotics-u0.html 获取。