论文

NAMVIS:下一代自回归多视图图像合成

NAMVIS: Next-Scale Autoregressive Multi-View Image Synthesis

模型架构新型架构

摘要

稀疏视图新颖视图合成是 3D 内容创建中的核心问题,但基于扩散的方法仍然受到迭代去噪的限制,使得多视图生成在推理时成本高昂。我们引入 NAMVIS,一种无扩散框架,它将多视图图像合成重新表述为几何条件下的下一尺度自回归。 NAMVIS 不是通过重复去噪来生成目标视图,而是通过少量从粗到细的尺度步骤来预测离散视觉token,同时对每个尺度内和跨目标视图并行采样所有token。为了将这一生成过程锚定到显式相机几何结构,我们提出了多尺度投影姿势编码,它将源和目标相机变换注入到每个分辨率的目标视图自注意力和源到目标交叉注意力中。 NAMVIS 进一步将全局调节与密集的几何感知交叉注意力相结合,使模型能够保留源视图外观,同时保持目标视图一致性。在 Objaverse、GSO 和 OmniObject3D 中,NAMVIS 在 PSNR、SSIM 和 LPIPS 方面优于基于扩散的基线,同时在相同的评估设置下运行速度比评估的扩散基线快 3 倍以上。这些结果表明,几何条件下的下一尺度自回归是稀疏视图多视图合成中扩散的一种有前途且有效的替代方案。如需其他定性结果、视频和资源,请访问 https://corl-team.github.io/namvis/

NAMVIS:下一代自回归多视图图像合成的原论文方法或结果图
图 2:NAMVIS 架构概述。源图像由冻结的 VQ-VAE 编码为源特征,这些特征被汇集到序列起始token [SOS] 中,并且还用作密集交叉注意力的键值对。自回归变压器按尺度预测目标残差token尺度,并将多尺度 ProPE 注入自注意力(在目标视图中)和交叉注意力(从目标到源)。冻结的 VQ-VAE 解码器将最终累积的特征映射到图像。