论文
频域中的单图像到纹理 3D 对象生成:从理论到流程
Single Image to Textured 3D Object Generation in Frequency Domain: From Theory to Pipeline
摘要
由于信息极度缺乏,单视图 3D 重建(也称为图像到 3D)一直是一项具有挑战性的任务。最近,在作为 2D 先验的大规模数据集上预训练的扩散模型被用来解决不适定任务,但会遇到颜色偏差和视图不一致的问题,这可以通过使用作为 3D 先验的 3D 带注释数据进行微调的扩散模型来解决。然而,3D 先验缺乏高频细节,无法通过在空间域中与 2D 先验直接互补来解决,从而引入错误的低频 2D 先验引导。在本文中,我们从频率角度重新审视不同扩散先验的特征。根据我们的观察,我们理论上提出了一个使用频域中的多重扩散先验的混合优化的统一框架。在此框架下,我们进一步提出了 Morpheus3D,这是一种从野外任何单个未摆出的图像生成 3D 对象的管道。 Morpheus3D通过高通图像提示2D先验引导增强3D先验,重建高质量3D物体,同时有效抑制视图不一致、低频颜色偏差和高频缺失问题。对公众和我们收集的具有复杂纹理的数据集的定量和定性实验都表明,我们的方法在生成质量方面表现出了显着的改进。