论文
可扩展空间生成的模态强制
Modality Forcing for Scalable Spatial Generation
摘要
文本到图像(T2I)模型包含丰富的空间先验。合成逼真、杂乱的场景需要了解几何学,包括透视和相对比例。先前的工作采用 T2I 模型来利用此先验进行深度预测,但它们需要密集的深度数据并涉及复杂的配方。我们提出了 Modality Forcing,这是一种简单、可扩展的 后训练 方法,用于使用在稀疏深度数据上训练的单个 DiT 来生成联合图像深度。模态强制通过为每个模态分配单独的噪声级别,可以有条件地联合生成任何排列中的图像和深度。每模态解码器让我们能够训练稀疏的真实世界深度,并实现强大的、可概括的深度预测。我们进一步证明模态强制继承了 T2I 预训练 的可扩展性:通过从头开始训练一组 T2I 模型(370M 到 3.3B 参数),我们发现在更多图像数据上训练的更大模型会产生更准确的深度。我们最强大的模型可与最先进的单目深度估计器相媲美,并且相对于现有的联合图像深度生成模型,AbsRel 降低了 57%。这些结果提供了强有力的证据,证明图像生成是空间感知的可扩展 预训练 目标。 https://modality-forcing.github.io/