论文
Depth-to-RGB:以冻结深度估计器引导物体图像合成
Depth-to-RGB: Repurposing a Frozen Depth Estimator for Geometry-Guided Compositing
摘要
基于参考的对象合成使用背景图像、参考图像和 2D 合成蒙版插入或替换对象。这些输入指导外观和放置,但使完成的场景的几何形状保持隐式,这可能会扭曲对象结构或改变周围环境。我们的深度到 RGB (D2R) 框架可以预测 RGB 输入中尚未观察到的场景的合成深度。它使用成对完成场景的编码器特征作为目标,学习对冻结深度估计器的参考条件校正。未改变的解码器将校正后的表示映射到预期场景的深度,单独训练的渲染器在 RGB 合成期间保持固定。在匹配的架构和训练下,编码器特征监督相对于解码深度监督将 OOD Stage-1 AbsRel 减少了 31.4%。我们还引入了 AnyInsertion++ 以及配对的分布内分割和类别不相交分割,以评估合成训练类别之外的泛化能力。完整的 D2R 系统在两个配对分裂的估计器导出的几何和光度质量方面领先 12 个开源基线和 3 个闭源基线。在类别不相交的数据上,与匹配的 RGB 基线相比,D2R 将 AbsRel 降低了 43.7%,并将 PSNR 提高了 2.4 dB。在三个未配对的基准中,D2R 领先于两个身份指标,并将平均 CLIP 参考余弦距离相对于最强基准减少了 55%。项目页面:https://shjo-april.github.io/Depth2RGB/
