论文
通过分解的视觉代理直接插入 3D 感知对象
Direct 3D-Aware Object Insertion via Decomposed Visual Proxies
摘要
对象插入旨在将参考对象无缝地合成到背景图像的指定区域中。最近基于扩散的方法实现了高视觉质量,但将插入制定为简单的 2D 修复任务,无法提供对对象 3D 姿势的明确控制,并限制了其实际适用性。我们提出了 DIRECT(参考合成和目标集成的分解注入),这是一种新颖的框架,它将交互式姿势操作与高保真 2D 图像合成相结合,以实现姿势可控的对象插入。我们的方法将插入条件分解为三个互补的组成部分:从参考对象捕获视觉细节的外观指导、从用户调整的 3D 代理导出的几何指导以及来自目标背景的上下文指导。通过通过单独的路径注入它们,DIRECT 避免了特征纠缠,同时保留参考外观,遵循用户指定的姿势,并使对象适应目标场景。我们还引入了自动化数据构建管道,以提高训练数据的多样性和质量。实验表明,DIRECT 在几何可控性和视觉质量方面都优于以前的方法。