论文

通过几何感知预训练增强上下文全景生成

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

模型训练预训练

摘要

在这项工作中,我们提出了 Canvas360,这是一个用于上下文全景生成的两阶段框架,它将几何感知预训练与下游特定任务 微调 相结合。为了解决缺乏针对上下文全景任务定制的大规模、高质量训练数据的问题,我们提出了 Canvas360Dataset,它是 1M 高质量配对全景样本的集合,用于风格迁移、修复、外绘和编辑,从而能够对不同的上下文生成场景进行有效监督。在建模方面,Canvas360 通过并行深度生成、速度圆形填充和相似性损失正则化增强了文本到全景的生成,使模型能够学习几何感知表示、捕获对象失真细节并提高几何一致性和全局连贯性。此外,在强大的全景先验的支持下,Canvas360 实现了统一的上下文全景生成框架,该框架通过 词元级 连接支持各种下游任务,在任务覆盖范围和建模灵活性方面超越了现有方法。大量实验表明,Canvas360 提高了全景图像保真度,在全景特定 FAED 指标上实现了特别强劲的性能,并在报告的定量评估中取得了具有竞争力或领先的结果。更多信息可以在我们的项目页面上找到:https://zry000.github.io/Canvas360/