论文

Cosmos 3:物理 AI 的全模态世界模型

Cosmos 3: Omnimodal World Models for Physical AI

模型架构混合架构

摘要

我们推出了 Cosmos 3,这是一系列全模态世界模型,旨在在统一的 Transformer 架构混合中联合处理和生成语言、图像、视频、音频和动作序列。通过支持高度灵活的输入输出配置,Cosmos 3 无缝地统一了物理 AI 的关键模式——有效地将视觉语言模型、视频生成器、世界模拟器和世界动作模型纳入一个框架中。我们的评估表明,Cosmos 3 在一系列不同的理解和生成任务中建立了一种新的最先进技术,展示了全模态世界模型作为实体代理的可扩展、通用的骨干。在撰写技术报告时,我们训练后的 Cosmos 3 模型被 Artificial Analysis 评为最佳开源文本到图像和图像到视频模型,并被 RoboArena 评为最佳策略模型。为了加速物理 AI 的开放研究和部署,我们根据 Linux 基金会的 OpenMDW-1.1 许可证(https://github.com/nvidia/cosmos 和 https://huggingface.co/collections/nvidia/cosmos3)提供代码、模型检查点、精选合成数据集和评估基准。该项目网站位于 https://research.nvidia.com/labs/cosmos-lab/cosmos3。