论文

通过动态特征归一化稳定流视频几何

Stabilizing Streaming Video Geometry via Dynamic Feature Normalization

模型架构递归架构

摘要

根据流式 RGB 输入进行一致的 3D 几何估计对于自动驾驶、嵌入式 AI 和大规模重建等现实应用至关重要。虽然现代单目几何基础模型实现了很强的单图像精度,但它们在连续输入上表现出严重的时间不一致,特别是尺度移位漂移。通过有针对性的实证分析,我们将这种不稳定性追溯到其根本原因:潜在特征统计数据的波动,其均值和方差直接决定了预测深度的尺度和偏移。基于这一见解,我们引入了动态特征归一化(DyFN),这是一个轻量级的因果循环模块,可以动态、稳健地调节特征统计数据,以随着时间的推移保持稳定的几何形状。我们通过仅微调 DyFN(仅 2% 的附加参数)来适应强大的预训练单目几何模型,同时保持主干冻结,从而在不影响单图像精度的情况下实现时间一致性。跨越四个基准的大量实验表明,DyFN 有效消除了时间伪像,例如脱节的分层和位置抖动,并实现了最先进的时间稳定性,比之前的流媒体方法提高了 14%,甚至超越了更重的非因果视频基线。项目页面:https://shawlyu.github.io/DyFN