论文
DVSM:仅解码器视图合成模型正确完成
DVSM: Decoder-only View Synthesis Model Done Right
摘要
最近的大视图综合模型(LVSM)提倡一种编码器-解码器架构,将重建和渲染分离到不同的网络中。我们重新审视这个设计。通过受控实验,我们表明,仅解码器架构将场景隐式表示为 KV 缓存,其性能优于编码器-解码器变体,同时在相同的渲染复杂度下使用更少的参数。进一步的分析表明,颜色输入重建网络和仅相机渲染网络之间共享权重可以更好地在同一视点对齐它们的特征,从而促进图像合成。基于这一发现,我们的模型(称为 DVSM)进一步结合了基础模型先验和阶段性补丁大小调整,以提高效率与质量的权衡。我们的结果为跨多个基准的新颖视图合成建立了新的技术水平,在某些情况下甚至在密集输入视图下优于按场景优化的 3DGS。