论文
LSRM:通过缩放上下文窗口进行高保真以对象为中心的重建
LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows
摘要
我们引入大型稀疏重建模型来研究缩放 Transformer 上下文窗口如何影响前馈 3D 重建。尽管最近的以对象为中心的前馈方法产生了稳健的、高质量的重建,但它们在恢复细粒度纹理和外观方面仍然落后于密集视图优化。我们表明,通过大幅增加活动对象和图像标记的数量来扩展上下文窗口,可以缩小这一差距并实现高保真 3D 对象重建和逆向渲染。为了有效扩展,我们采用原生稀疏注意力进行 3D 重建,具有三个关键贡献:(1)高效的从粗到细的管道,通过预测稀疏高分辨率残差将计算集中在信息区域; (2) 3D 感知空间路由机制,使用明确的几何距离而不是标准注意力分数来建立准确的 2D-3D 对应关系; (3) 采用 All-gather-KV 协议的自定义块感知序列并行策略,以平衡 GPU 之间的动态、稀疏工作负载。因此,与之前最先进的 (SOTA) 方法相比,LSRM 处理的对象标记数量多了 20 倍,图像标记数量多了 2 倍。对标准新颖视图综合基准的广泛评估表明,与当前的 SOTA 相比,取得了显着的进步,PSNR 提高了 2.4dB 以上,LPIPS 降低了 40% 以上。此外,当将 LSRM 扩展到逆渲染时,对广泛使用的基准的定性和定量评估表明纹理和几何细节得到了一致的改进,实现了与 SOTA 密集视图优化方法相匹配或超过的 LPIPS。我们的项目页面上提供了代码和模型权重。