论文
AnyRecon:使用视频扩散模型进行任意视图 3D 重建
AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model
摘要
稀疏视图 3D 重建对于随意捕捉的场景建模至关重要,但对于非生成重建仍然具有挑战性。现有的基于扩散的方法通过合成新颖的视图来缓解这个问题,但它们通常仅以一两个捕获帧为条件,这限制了几何一致性并限制了大型或不同场景的可扩展性。我们提出了 AnyRecon,这是一个可扩展的框架,用于从任意和无序的稀疏输入进行重建,保留显式的几何控制,同时支持灵活的条件基数。为了支持远程调节,我们的方法通过预先设置的捕获视图缓存构建持久的全局场景内存,并删除时间压缩以在大视点变化下保持帧级对应。除了更好的生成模型之外,我们还发现生成和重建之间的相互作用对于大规模 3D 场景至关重要。因此,我们引入了一种几何感知调节策略,该策略通过显式 3D 几何内存和几何驱动的捕获视图检索将生成和重建结合起来。为了确保效率,我们将 4 步扩散 蒸馏 与上下文窗口稀疏注意力相结合,以降低二次复杂度。大量的实验证明了在不规则输入、大视点间隙和长轨迹上的稳健和可扩展的重建。