论文
NAMVIS:下一代自回归多视图图像合成
NAMVIS: Next-Scale Autoregressive Multi-View Image Synthesis
摘要
稀疏视图新颖视图合成是 3D 内容创建中的核心问题,但基于扩散的方法仍然受到迭代去噪的限制,使得多视图生成在推理时成本高昂。我们引入 NAMVIS,一种无扩散框架,它将多视图图像合成重新表述为几何条件下的下一尺度自回归。 NAMVIS 不是通过重复去噪来生成目标视图,而是通过少量从粗到细的尺度步骤来预测离散视觉token,同时对每个尺度内和跨目标视图并行采样所有token。为了将这一生成过程锚定到显式相机几何结构,我们提出了多尺度投影姿势编码,它将源和目标相机变换注入到每个分辨率的目标视图自注意力和源到目标交叉注意力中。 NAMVIS 进一步将全局调节与密集的几何感知交叉注意力相结合,使模型能够保留源视图外观,同时保持目标视图一致性。在 Objaverse、GSO 和 OmniObject3D 中,NAMVIS 在 PSNR、SSIM 和 LPIPS 方面优于基于扩散的基线,同时在相同的评估设置下运行速度比评估的扩散基线快 3 倍以上。这些结果表明,几何条件下的下一尺度自回归是稀疏视图多视图合成中扩散的一种有前途且有效的替代方案。如需其他定性结果、视频和资源,请访问 https://corl-team.github.io/namvis/
