论文

WaterGen:水下图像生成中场景和介质的解耦

WaterGen: Decoupling Scene and Medium in Underwater Image Generation

应用与实践内容创作

摘要

水下计算机视觉任务,例如检测、恢复和分割,由于缺乏大规模和多样化的训练数据而受到限制。我们介绍了 WaterGen,这是一种生成大规模、逼真和多样化水下图像的方法,可提供对场景和水介质条件的独立控制。我们的方法将水下图像生成视为两个因素的解耦控制:真实且多样化的场景内容(图像中的内容),以及准确且可控的水介质效果(水对图像的作用)。现有方法通常只能实现此目标的一部分:它们要么提供有限真实性或多样性的可控性,要么生成真实场景,而无法准确且独立地建模水介质效果。我们的关键见解使我们能够避免这种妥协,即场景生成和介质建模可以在潜在扩散框架内解耦,从而实现多样化的场景生成以及准确且可控的水下外观。为此,我们将水下图像合成分解为两个阶段。首先,我们使用无退化水下图像对潜在扩散 U-Net 进行微调,使其能够学习生成水下场景内容的多样化且真实的潜在嵌入,而不会出现介质引起的退化。其次,我们将物理上准确的介质退化合成制定为应用于这些潜在嵌入的条件解码过程。这种解耦设计使我们的模型能够生成不同的场景,并完全控制水下外观。我们利用 WaterGen 构建大规模合成水下数据集,该数据集场景结构多样,水效果和伪标签准确。我们证明,我们的合成数据不断提高水下恢复和语义分割的下游性能。