论文

ReScene:从多视图捕获中重建结构化室内场景

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

应用与实践视觉感知与空间理解

摘要

从多视图捕获构建模拟就绪的 3D 场景是嵌入式人工智能的关键瓶颈,因为下游任务需要对象级结构、明确的对象间关系和物理合理性。现有的方法要么依赖于专门的捕获硬件,在对象重建中受到单视图偏差的影响,要么产生几何上合理但物理上不一致的布局。我们发现问题不是单一对象重建,而是跨视图关系融合和物理上合理的场景组装。为了应对这一挑战,我们提出了 ReScene,这是一个框架,它将多视图几何图形作为统一的先验贯穿整个管道。我们的方法由两个主要部分组成:HierView 根据语义一致性和 3D 覆盖完整性对重建视图进行优先级排序,取代将图像占用率与对象覆盖率混为一谈的最大掩模启发法;关系感知装配将来自视觉语言模型的多帧关系预测与几何和房间外壳先验融合到置信加权场景图中,从而实现物理上一致的场景装配。 ReScene 在一组 ScanNet 场景的几何、渲染和感知质量方面树立了新的技术水平,与之前最强的基线相比,倒角距离减少了 17%,LPIPS 减少了 26%,同时运行速度比以前的多视图方法快了 10 倍。基于重建的场景,我们还生成了一个具体的视觉问答数据集,在该数据集上,经过微调的 Qwen-VL 在多个空间推理任务上的性能接近强大的闭源模型。