论文

通过自我提升 4D 感知 蒸馏

Self-Improving 4D Perception via Self-Distillation

模型训练预训练

摘要

大规模多视图重建模型已经取得了显着进展,但大多数现有方法仍然依赖于 真值 3D/4D 注释的完全监督训练。此类注释非常昂贵,并且对于动态场景来说尤其稀缺,从而限制了可扩展性。我们提出了 SelfEvo,一个自我改进的框架,可以使用未标记的视频不断改进预训练的多视图重建模型。 SelfEvo 引入了一种利用时空上下文不对称性的 self-蒸馏 方案,无需外部注释即可实现基于学习的 4D 感知的自我改进。我们系统地研究使自我改进有效的设计选择,包括损失信号、不对称形式和其他训练策略。在跨越不同数据集和领域的八个基准测试中,SelfEvo 不断改进预训练基线并在基础模型(例如 VGGT 和 $π^3$)上进行泛化,在动态场景上取得了显着的进步。总体而言,在不使用任何标记数据的情况下,SelfEvo 在视频深度估计方面实现了高达 36.5% 的相对改进,在相机估计方面实现了 20.1% 的相对改进。项目页面:https://self-evo.github.io/。