论文

SFE-VGGT:用于基于事件的单目深度估计的无源 VGGT 蒸馏

SFE-VGGT: Source-Free VGGT Distillation for Event-Based Monocular Depth Estimation

摘要

最近基于事件的深度估计方法通过跨模式蒸馏成功地从视觉基础模型转移了几何先验。然而,它们在训练期间对同步 RGB 事件对或深度注释的依赖严重限制了实际部署。为了克服这个瓶颈,我们提出了 SFE-VGGT,这是一种新颖的无源框架,它将 VGGT 的几何先验提炼到事件域,而无需任何配对的 RGB 观察。我们的核心思想是直接从目标事件流重建代理帧,充当冻结的几何老师,完全消除对真实源 RGB 数据的需要。至关重要的是,由于这些代理框架本质上会产生不完美且空间变化的监督,因此直接从它们中提取会传播伪影。为了解决这个问题,我们引入了一种新颖的可靠性感知蒸馏策略。这包括强调信息事件区域的密度感知特征蒸馏,以及基于相对师生预测置信度动态调节监督的置信加权深度蒸馏。同时,我们提出了一种跨帧关系一致性损失,它使用可靠的帧间对应来强制时间几何稳定性,绕过了对时间一致的教师深度的需要。大量实验表明,尽管无源,我们的 SFE-VGGT 在标准条件下与 RGB 相关基线的准确性非常接近,并且在具有挑战性的夜间场景中显着超过了它们。在 MVSEC 夜间序列中,与 EventVGGT 相比,SFE-VGGT 将平均 10 m 深度误差降低了 15.3%。此外,我们的方法在现实世界数据集中表现出强大的零样本泛化能力,证明可以使用严格的无源监督将高效的几何先验转移到事件相机。