论文

自监督单目视频深度估计的 3D 一致性优化

3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation

应用与实践视觉感知与空间理解

摘要

可靠的单目视频深度估计对于内窥镜导航中的下游 3D 推理和嵌入式 AI 至关重要。然而,现有的自监督方法通常独立处理视频帧或依赖于弱时间正则化。这些方法缺乏对底层 3D 场景的整体感知,不可避免地会出现几何不一致的预测和严重的跨帧漂移。为了解决这些限制,我们引入了一种新的范例,将顺序视频深度估计重新定义为无约束的多视图 3D 重建问题,从而能够充分利用嵌入在最新 3D 基础模型中的强大几何先验。我们方法的核心是由三个约束驱动的 3D 一致性优化框架:图像级光度渲染、显式世界坐标几何对齐和多尺度时间梯度一致性。这种统一的优化优雅地将孤立的框架锚定到全局连贯的 3D 结构。我们的方法已在自我监督训练场景和具有挑战性的零样本临床环境中得到验证。结果表明,所提出的方法实现了最先进的空间精度,优于基于帧、基于视频的深度估计器和多视图 3D 重建基线。