论文
Dyna3:通过深度基础模型进行 VLM 引导的免训练 4D 重建
Dyna3: VLM-Guided Training-Free 4D Reconstruction via Depth Foundation Models
摘要
最近的深度基础模型,如 Depth Anything 3 (DA3),实现了出色的多视图深度估计,但假设静态 3D 场景,限制了它们对现实世界动态环境的适用性。现有的免训练 4D 方法(如 Easi3R 和 VGGT4D)依赖于对应训练的主干,其注意力编码跨帧匹配,这是 DA3 等仅深度模型所缺乏的属性。我们提出了 Dyna3,这是一个免训练框架,可扩展 DA3 以进行 4D 动态场景重建,无需任何微调。我们的主要见解是,DA3 的跨视图特征虽然仅针对深度一致性进行训练,但在与跨帧的最佳匹配特征搜索相结合时,会隐式编码运动辨别信号。它的静态表面在全局范围内找到一致的匹配,而动态对象则不能。我们进一步采用视觉语言模型 (VLM) 为 SAM 3 自动生成场景特定的语义提示,从而实现精确的实例级分割,区分哪些对象正在移动,哪些对象存在。为了重建,我们将场景解耦为跨帧对齐的静态背景和每帧动态点云。对四个数据集的实验表明,Dyna3 在动态对象分割方面超越了对应训练方法,其J-Mean相对最先进的VGGT4D提高5.5个百分点,同时实现了高达 13 倍的姿态估计速度和 3 倍的 4D 重建速度,同时内存减少了 4 到 8 倍。因此,Dyna3 可以实现先前方法无法支持的更密集的时间采样。