论文

AIMS:用锚点聚合扩展大型视图合成模型的输入

AIMS: Anchor-Integrated Multi-View Synthesis for Scalable Novel View Rendering

模型推理推理加速

摘要

前馈新颖的视图合成方法从多视图输入中实现了强大的泛化,但将它们扩展到大型输入视图集仍然具有挑战性。随着视图数量的增长,联合处理所有输入视图 token 的基于 Transformer 的方法会导致计算量和 记忆 迅速增加,而简单的视图子采样会丢弃潜在有用的观察结果。我们引入了锚集成多视图合成(AIMS),这是一个可扩展的框架,它将可用观察的数量与全局合成模型处理的视图的数量分离。 AIMS 使用最远点采样选择一组固定的空间分布锚视图,将每个锚周围的附近观察结果分组,并使用轻量级可学习积分器将其信息融合为丰富的锚表示。这允许额外的观察有助于综合,同时保持下游全局视图预算固定。对 RealEstate10K 和 ScanNet 的评估表明,与基于变压器和基于高斯的基线相比,具有良好的质量效率权衡。 AIMS 在两个数据集上分别实现了 29.41 dB 和 17.73 dB PSNR,每个视图的渲染平均时间为 7.24 毫秒。

AIMS:用锚点聚合扩展大型视图合成模型的输入:论文原图
图 1:AIMS 概述。覆盖感知分组选择锚点和相邻视图。视图组编码器将每个组的光线条件图像 token 压缩为紧凑场景 token。全局解码器将这些与目标射线 token 结合起来以合成新颖的视图。