论文
OrbitForge:通过重建锚定视频合成生成文本到 3D 场景
OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis
摘要
通用文本到视频模型可以用作丰富的开放世界场景先验。尽管当今生成的视频质量很高,但它们并不能直接生成可靠的 3D 资产:摄像机运动难以控制、视图覆盖不完整,并且帧通常包含随时间不一致的内容。我们介绍了 OrbitForge,这是一个由冻结视频先验和按提示高斯 Splatting 重建优化构建的适配器,可将单个文本生成的视频转换为规范的闭轨 3D 高斯 Splatting 场景。我们使用 3D 重建作为锚点来提高生成视频的 3D 一致性。我们使用强大的 MedianGS 代理通过可变形高斯泼溅从第一个生成的视频中获得初步 3D 重建。我们从规定的轨道渲染视图以检测缺失的视点。 OrbitForge 使用文本到视频模型仅完成缺失的视图,并将完成的轨道重建为最终的高斯溅射场景。这一设计不需要特定于任务的视频或多视图 微调,避免了每次提示分数 蒸馏 优化,并且不会一次一步地逐步生成视图。我们进一步认为,这种设置需要覆盖感知评估:仅局部平滑度就奖励从不尝试完整轨道的方法。在基于 T3Bench 的冻结 300 提示审核中,OrbitForge 重建获得了 359.0 度的测量中值跨度,相对于仅 MedianGS 重建,将最初不受支持的 bin Q10 ImageReward 从 8.07 提高到 16.36,同时在覆盖质量上与 VideoMV 保持竞争力。