论文

UMI3D:通过同时焦点交叉注意路由在无约束多图像输入上进行鲁棒 3D 生成

UMI3D: Robust 3D Generation on Unconstrained Multi-Image Inputs via Simultaneous Focus Cross-Attention Routing

模型推理解码与生成控制

摘要

最近的 3D 基础模型可以从单个图像生成高质量资源,但在不受约束的多图像输入上会显着降低,通常会产生扭曲的几何形状、过度平滑的纹理和混乱的颜色。我们认为,这种失败并非源于有限的模型容量,而是源于单图像交叉注意力与多图像设置之间的不匹配:现有模型缺乏原则性方法来决定每个 3D 体素在每个去噪步骤中应该信任哪个图像。回顾最近的单图像 3D 基础模型,我们发现将每个体素显式路由到其信息最丰富的图像足以在不一致的多图像输入上释放强大的性能。基于这一观察,我们提出了 UMI3D,一种 无需训练 和即插即用框架,可以重组交叉注意力以实现无约束的多图像 3D 生成。其核心是同步焦点交叉注意(SFC-Attn),在每个去噪步骤激活所有调节图像,同时允许每个体素聚焦于最能解释它的单个图像。为了实现这种路由,我们导出了体素参考分数(VRS),这是体素图像亲和力的模型内在度量,不需要外部匹配、分割或对应模型。大量实验表明,UMI3D 释放了单图像 3D 生成框架在不同任务中的多图像潜力。项目页面:UMI3D-Project.github.io。