论文
基于几何的 3D 基础模型的潜在黎曼流匹配
Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models
摘要
几何基础模型,例如 Visual Geometry Grounded Transformer (VGGT),可从未摆姿势的图像中提供强大的 3D 先验。然而,此类模型纯粹在前馈、确定性机制中运行,即它们无法生成超出输入视图直接支持的合理几何形状。另一方面,3D 场景的生成模型必须依赖强大的几何先验来从稀疏输入生成一致的输出。我们通过直接在 VGGT 的潜在空间中执行流匹配来桥接这两种范式,利用其学习的 3D 先验,而不致力于任何显式的下游表示,例如高斯、网格或视频 VAE 潜在。这需要尊重潜在的几何结构:VGGT 词元占据高维超球面的乘积,而标准欧几里德流匹配在该高维超球面上失败。我们通过在四个超球面的乘积流形上定义的黎曼流匹配框架来解决这个问题,该框架与 VGGT 的多尺度编码器对齐,将生成的词元保留在冻结解码头所需的有效数据流形上。在 RealEstate10K、ScanNet++ 和 ETH3D 上,我们的方法在每个视图外观和聚合 3D 几何中相对于最近的场景生成基线实现了强大的性能,在几何基础模型上建立了潜在空间流匹配作为 3D 生成的可行范例。项目页面可以在$\href{https://lisaweijler.github.io/geometry-grounded-rfm/}{\text{here}}$找到。