论文
Pixal3D:从图像生成像素对齐的 3D
Pixal3D: Pixel-Aligned 3D Generation from Images
摘要
3D 生成模型的最新进展迅速提高了图像到 3D 合成的质量,实现了更高分辨率的几何形状和更真实的外观。然而,测量生成的 3D 资源与输入图像的像素级 忠实性 的保真度仍然是一个主要瓶颈。我们认为这源于隐含的 2D-3D 对应问题:大多数 3D 原生生成器在规范空间中合成形状,并通过注意力注入图像线索,从而使像素到 3D 的关联变得模糊。为了解决这个问题,我们从 3D 重建中汲取灵感,并提出了 Pixal3D,这是一种像素对齐的 3D 生成范例,用于从图像创建高保真 3D 资源。 Pixal3D 不是以规范姿势生成,而是直接以像素对齐的方式生成 3D,与输入视图一致。为了实现这一点,我们引入了一种像素反投影调节方案,该方案将多尺度图像特征显式提升到 3D 特征体积中,建立直接的像素到 3D 对应关系,而不会产生歧义。我们证明,Pixal3D 不仅具有可扩展性,能够生成高质量的 3D 资源,而且还大幅提高了保真度,接近重建的保真度水平。此外,Pixal3D 通过聚合跨视图的反向投影特征体积,自然地扩展到多视图生成。最后,我们展示了像素对齐生成场景合成的好处,并提出了一个模块化管道,可以从图像中生成高保真、对象分离的 3D 场景。 Pixal3D 首次演示了大规模 3D 原生像素对齐生成,并为从单视图或多视图图像中高保真 3D 生成对象或场景提供了一种新的鼓舞人心的方式。项目页面:https://ldyang694.github.io/projects/pixal3d/