论文

StreetDiff:通过具有结构提示的跨视图一致多视图稳定扩散生成多视图街道场景

StreetDiff: Multi-view Street Scenes Generation via Cross-view Consistent Multi-view Stable Diffusion with Structure Prompts

模型推理解码与生成控制

摘要

多视图扩散模型在具有强几何先验和稀疏语义的场景中表现出了强大的性能,例如室内房间或简单的室外环境(例如田野、庭院)。然而,它们通常无法在相机旋转下保持跨视图一致性,特别是在结构复杂的城市环境中。如果没有跨视图的球形对应的显式建模,现有方法往往会产生对象重复、结构扭曲和布局不一致。为了解决这个限制,我们提出了 StreetDiff,一个多视图扩散框架,它在去噪过程中明确强制执行跨视图对齐。 StreetDiff 引入了全景-透视协同设计,将全局布局推理与局部细节合成解耦,并结合了全景对齐模块 (PAM),该模块在视图之间建立基于球形投影的注意力约束。通过注入结构化对齐约束而不修改扩散主干,我们的框架在具有挑战性的城市街道场景生成任务中实现了强大的跨视图一致性。此外,我们构建了大规模 HDR 多视图城市全景数据集 Street360。大量实验表明,与之前的多视图扩散生成方法相比,StreetDiff 显着提高了结构一致性和视觉保真度。