论文
Genie 4D:语义先验引导的 4D 动态场景重建
Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction
摘要
在计算机视觉和机器人感知的交叉点,动态场景的 4D 重建将底层几何感知与高级语义理解联系起来。我们推出了 Genie 4D,这是一个框架,可将手持手机采集的数据转变为语义基础、动作可控的 4D 世界模型。 Genie 4D 将用于度量几何的实时视觉惯性高斯溅射前端与前馈 4D 主干结合起来,该主干由充当结构先验的冻结 DINOv3 特征进行正则化。语义先验抑制了动态跟踪期间的身份漂移,而短条件扩散细化器则恢复了回归主干平滑掉的高频表面细节。最后,轻量级潜在动作头将重建的 4D 状态暴露给使用 JEPA 式下一个嵌入目标训练的 Genie 式世界模型,以便场景可以在用户操作下前滚。在 Point Odyssey 和 TUM-Dynamics 基准测试中,Genie 4D 保留了前馈基线的线性时间复杂度 O(T),同时提高了 3D 跟踪精度 (APD) 和重建完整性,并且它可以在来自 iPhone、Mac、Windows 和 Linux 捕获客户端的单个消费级 GPU (RTX 5090) 上交互运行。 Genie 4D 提供了一条实用的、语义优先引导的路径来构建基于物理的世界模型。