论文

MMDiff:扩展扩散 Transformer 以实现多模态生成

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

模型评测模型行为与机制分析

摘要

Diffusion Transformer 表现出了卓越的生成能力,但一旦内容被渲染,在其去噪轨迹上计算的丰富感知表示就会被丢弃。我们提出了 MMDiff,一个将冻结扩散 Transformer 转换为多模态生成系统的框架,该系统使用轻量级解码器头与密集感知模态的任意组合共同生成图像。我们的中心发现是,感知信息沿着去噪轨迹在时间上分布,并且具有空间变化聚合权重的多时间步特征融合至关重要,与单时间步提取相比,语义分割结果提高了高达 28.7% mIoU。我们进一步采用概念驱动的注意力提取来进行可解释的空间引导,并表明冻结扩散特征与 DINOv3 等最先进的编码器具有竞争性和互补性。通过在冻结主干上仅训练轻量级解码器头,我们在语义分割、显着对象检测和深度估计方面实现了强大的性能,并证明该框架能够大规模生成有效的合成数据。