论文
这些视图可以成为一个场景吗?当 3D 基础模型出现幻觉时评估多视图 3D 一致性
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
摘要
多视图 3D 评估假设所评分的图像是对一个静态 3D 场景的观察。这种假设在 NVS 和稀疏视图重建中可能会失败:输入或生成的输出可能包含伪影、异常帧、重复视图或噪声,但仍然获得高 3D 一致性分数。现有的基于参考的度量需要 真值,而无 真值 的度量(例如 MEt3R)依赖于学习的重建主干,其故障模式特征描述很差。我们通过比较神经重建先验与经典几何验证来研究这个可靠性问题。我们引入了 \benchmark,一个用于多视图 3D 一致性的受控鲁棒性基准,以及一个将神经指标分解为骨干、残差和聚合组件的参数族。该家族恢复了 MEt3R 并产生了稳健性高达 $3\times$ 的变体。我们的分析表明,VGGT、MASt3R、DUSt3R 和 Fast3R 可以产生对不相关场景、重复图像和随机噪声的密集几何和跨视图支持的幻觉。我们引入了基于 COLMAP 的指标,该指标使用匹配、注册、密集支持和重建失败作为故障感知一致性信号。在真实的 NVS 输出和结构化人类研究中,这些指标与人类判断的相关性比 MEt3R 高出 4 倍。