论文

Omni123:以统一二维与三维生成缓解三维数据稀缺

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

模型训练预训练

摘要

最近的多模态 大语言模型 在统一文本和图像理解和生成方面取得了强大的性能,但由于数据有限,将这种原生能力扩展到 3D 仍然具有挑战性。与丰富的 2D 图像相比,高质量的 3D 资源稀缺,使得 3D 合成受到限制。现有方法通常依赖于间接管道,这些管道在 2D 中进行编辑并通过优化将结果提升到 3D,从而牺牲了几何一致性。我们推出了 Omni123,这是一种 3D 原生基础模型,它将文本到 2D 和文本到 3D 的生成统一在一个自回归框架内。我们的主要见解是图像和 3D 之间的跨模态一致性可以作为隐式结构约束。通过将文本、图像和 3D 表示为共享序列空间中的离散标记,该模型利用丰富的 2D 数据作为几何先验来改进 3D 表示。我们引入了一种交错的 X-to-X 训练范例,可以在异构配对数据集上协调不同的跨模态任务,而不需要完全对齐的文本-图像-3D 三元组。通过遍历自回归序列中的语义-视觉-几何循环(例如,文本到图像到 3D 到图像),该模型共同强制执行语义对齐、外观保真度和多视图几何一致性。实验表明,Omni123 显着改进了文本引导的 3D 生成和编辑,展示了通向多模态 3D 世界模型的可扩展路径。