论文

LiteMVS:具有基础 蒸馏 和专家聚合的高效多视图立体

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

摘要

实时 3D 感知对于机器人、增强现实和实体智能应用至关重要。现有的多视图立体(MVS)方法主要依赖于几何对应,这通常在无纹理或重复区域中失败,而单目深度模型利用强大的图像级先验,但缺乏强大的多视图几何约束。更重要的是,在机器人和实体操作场景中,高质量的 3D 几何不仅对于静态重建至关重要,而且还是学习时间一致的 4D 表示的关键基础。为了获得具有更强的结构意识和更大的时空扩展潜力的视觉表示,我们提出了 LiteMVS,一种轻量级的多视图深度估计模型,它将平面扫描几何推理与强大的单目语义和结构先验集成在一起。 LiteMVS的中心思想是将轻量级分割模型和大规模视觉基础模型获得的高级单目知识有效地注入到多视图立体框架中。特别是,LiteMVS 通过语义描述符丰富了成本量,并采用专家混合 (MoE) 公式来实现跨深度假设的自适应几何聚合。此外,从视觉基础模型中提取的几何先验进一步增强了单目引导,而不会增加推理成本。通过这样的设计,LiteMVS不仅提高了静态场景中的深度估计和3D重建质量,还为后续的时间建模和4D表示学习提供了更可靠的几何基础。 ScanNetv2 和 7-Scenes 上的实验表明,LiteMVS 实现了高质量的深度预测和 3D 重建,同时保持了有竞争力的效率。