论文

通过生成先验学习 3D 编辑,无需配对监督 蒸馏

Learning 3D Editing without Paired Supervision via Generative Prior Distillation

摘要

指令引导的 3D 编辑对于交互式内容创建至关重要,但它面临着一个重大瓶颈:高质量配对训练数据的严重缺乏。现有的方法试图通过依赖缓慢的测试时间优化或对通过复杂管道构建的伪对进行训练来绕过这个问题,这通常会引入结构漂移和几何伪影。在本文中,我们提出了一种新颖的框架,该框架可以通过生成先验 蒸馏 学习前馈 3D 编辑,而无需配对 3D 监督。我们的核心思想不是依赖 真值 3D 对,而是将强大的基础模型中的视觉、语义和几何知识直接提取到 3D 编辑模型中。具体来说,通过可微分渲染管道,我们使用两个互补信号来监督 3D 表示:来自主编辑视图中的图像编辑模型的 2D 视觉先验,以及来自新视图中的视觉语言模型的语义先验,以确保严格的指令遵循和源身份保留。至关重要的是,为了解决 2D 投影监督中固有的几何崩溃和多视图不一致问题,我们引入了 3D 感知分布匹配正则化。作为几何先验,该术语在 3D 潜在空间中运行,将编辑后的输出限制在由预训练图像到 3D 教师模型定义的现实 3D 资产的流形内。大量的实验表明,我们的方法实现了卓越的指令保真度和跨视图一致性,显着优于最先进的基线。我们的项目位于:https://github.com/thiamine128/PriorEdit3D。