论文

用于快速 无需训练 球形全景生成的线性融合多重扩散

Linear Fusion MultiDiffusion for Fast Training-Free Spherical Panorama Generation

模型推理推理加速

摘要

我们提出了 LF-MultiDiffusion,一种 无需训练 全景生成方法,它扩展了 MultiDiffusion 以支持目标和参考图像空间之间的线性投影。我们的关键思想是将潜在聚合重新表述为正则化最小二乘问题,并在去噪循环内使用基于 Krylov 的迭代求解器有效地解决它。与之前的 无需训练 方法相比,该公式能够实现更密集、更自然的映射,从而以更少的透视图产生更稳定的生成。因此,LF-MultiDiffusion 减少了去噪期间图像生成器评估的数量,并显着提高了推理效率。实验表明,LF-MultiDiffusion 比最强的 无需训练 基线实现了更好的视觉质量、文本对齐和全景一致性,同时提供了 15.36$\times$ 的加速。我们的项目页面位于:https://ahykw.github.io/lfmd。