论文

Depth-to-RGB:以冻结深度估计器引导物体图像合成

Depth-to-RGB: Repurposing a Frozen Depth Estimator for Geometry-Guided Compositing

应用与实践模型评测基准与评测资源内容创作视觉感知与空间理解

摘要

基于参考的对象合成使用背景图像、参考图像和 2D 合成蒙版插入或替换对象。这些输入指导外观和放置,但使完成的场景的几何形状保持隐式,这可能会扭曲对象结构或改变周围环境。我们的深度到 RGB (D2R) 框架可以预测 RGB 输入中尚未观察到的场景的合成深度。它使用成对完成场景的编码器特征作为目标,学习对冻结深度估计器的参考条件校正。未改变的解码器将校正后的表示映射到预期场景的深度,单独训练的渲染器在 RGB 合成期间保持固定。在匹配的架构和训练下,编码器特征监督相对于解码深度监督将 OOD Stage-1 AbsRel 减少了 31.4%。我们还引入了 AnyInsertion++ 以及配对的分布内分割和类别不相交分割,以评估合成训练类别之外的泛化能力。完整的 D2R 系统在两个配对分裂的估计器导出的几何和光度质量方面领先 12 个开源基线和 3 个闭源基线。在类别不相交的数据上,与匹配的 RGB 基线相比,D2R 将 AbsRel 降低了 43.7%,并将 PSNR 提高了 2.4 dB。在三个未配对的基准中,D2R 领先于两个身份指标,并将平均 CLIP 参考余弦距离相对于最强基准减少了 55%。项目页面:https://shjo-april.github.io/Depth2RGB/

Depth-to-RGB:以冻结深度估计器引导物体图像合成:论文原图
图 2:深度转 RGB (D2R) 概述。第 1 阶段(第 3.1 节)通过对冻结深度估计器中的背景特征进行参考条件校正来预测合成深度。第 2 阶段(第 3.2 节)合成 RGB,并在整个采样过程中保持固定的深度。训练会破坏包含配对 RGB、参考和目标深度 DD 的单独画布。深度去噪和 RGB 深度一致性始终以 DD 为目标,防止 DinD_{\mathrm{in}} 中的错误成为监督。