论文
ReplicateAnyScene:通过文本-视觉-空间对齐实现零镜头视频到 3D 合成
ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment
摘要
人类表现出一种与生俱来的能力,可以从视频观察中快速感知和分割物体,甚至在心理上将它们组装成结构化的 3D 场景。复制这种能力,称为组合 3D 重建,对于空间智能和嵌入式人工智能的进步至关重要。然而,由于跨模态信息集成不足,现有方法难以实现实际部署,导致它们依赖于手动对象提示,依赖辅助视觉输入,并且由于训练偏差而仅限于过于简单的场景。为了解决这些限制,我们提出了 ReplicateAnyScene,这是一个能够将随意捕获的视频完全自动化、零镜头转换为组合 3D 场景的框架。具体来说,我们的流程采用了五阶段级联,从跨文本、视觉和空间维度的视觉基础模型中提取通用先验并在结构上进行对齐,将它们扎根到结构化 3D 表示中,并确保所构建场景的语义一致性和物理合理性。为了便于对该任务进行更全面的评估,我们进一步引入了C3DR基准来从多个方面评估重建质量。大量实验证明了我们的方法在生成高质量合成 3D 场景方面优于现有基线。