论文

IGGT4D:流式传输 4D 实例依据对齐几何 Transformer

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

模型架构Transformer

摘要

现实世界的空间智能要求代理理解连续视频流中的场景,其中对象随着时间的推移移动、持续、消失和重新出现。虽然最近的空间基础模型已经实现了可推广的前馈 3D 重建,但大多数流方法仍然以几何为中心,并且缺乏时间一致的对象级理解。同时,现有的语义重建和 3D 感知视觉语言方法很大程度上依赖于外部提取的 2D 语义线索或松散耦合的几何输入,限制了长动态场景中的统一几何实例学习。在本文中,我们提出了 IGGT4D,一种基于流实例的几何图形 Transformer,用于在线 4D 场景理解。 IGGT4D 按顺序处理视频帧,通过因果时空建模重用历史背景,并增量更新摄像机运动、几何形状和对象身份的统一表示。这使得能够在动态环境中实现具有几何实例一致性的长序列前馈重建。为了解决缺乏高质量 4D 监督的问题,我们进一步构建了 InsScene4D-147K,这是一个跨越真实/合成和静态/动态场景的大型数据集,具有由自动几何引导注释管道生成的 RGB 图像、深度、姿势和时间一致的实例掩模。 3D 重建、姿态估计、实例空间跟踪和开放词汇分割的实验表明,IGGT4D 优于现有的流基线,同时保持长动态序列的可扩展在线推理。