论文

SIC3D:风格图像条件文本到 3D 高斯泼溅生成

SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation

应用与实践内容创作

摘要

文本到 3D 对象生成的最新进展使得能够利用 2D 扩散模型和可微分 3D 表示从文本输入合成详细的几何图形。然而,由于文本模态的限制,这些方法常常受到有限的可控性和纹理模糊性的影响。为了解决这个问题,我们提出了 SIC3D,一种具有 3D 高斯分布 (3DGS) 的可控图像条件文本到 3D 生成管道。 SIC3D 有两个阶段。第一阶段使用文本到 3DGS 生成模型从文本生成 3D 对象内容。第二阶段将风格从参考图像传输到 3DGS。在此风格化阶段,我们引入了一种新颖的变分风格化分数 蒸馏 (VSSD) 损失,以有效捕获全局和局部纹理模式,同时减轻几何和外观之间的冲突。进一步应用缩放正则化来防止伪影的出现并保留风格图像中的图案。大量实验表明,SIC3D 增强了几何保真度和风格一致性,在定性和定量评估方面均优于先前的方法。