论文

SpatialFusion:赋予统一图像生成固有的 3D 几何意识

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

模型架构混合架构

摘要

最近的统一图像生成模型通过采用 MLLM 进行语义理解和图像生成的扩散主干网取得了显着的成功。然而,由于缺乏内在的空间理解以及生成过程中缺乏明确的几何指导,这些模型在空间感知任务中仍然受到根本的限制。在本文中,我们提出了 SpatialFusion,这是一种将 3D 几何意识内化到统一图像生成模型中的新颖框架。具体来说,我们首先采用 Mixture-of-Transformer (MoT) 架构,通过并行空间 Transformer 增强 MLLM,以增强 3D 几何建模能力。通过与 MLLM 共享自注意力,空间 Transformer 学会从丰富的语义上下文中导出目标图像的度量深度图。然后,这些显式几何支架通过专门的深度适配器注入到扩散主干中,为空间相干图像的生成提供精确的空间约束。通过渐进的两阶段训练策略,SpatialFusion 显着增强了空间感知基准的性能,尤其优于 GPT-4o 等领先模型。此外,它在文本到图像生成和图像编辑场景中实现了普遍的性能提升,同时保持了可以忽略不计的推理开销。