论文
Pano2World:通过统一多视图序列进行端到端 3D 生成
Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences
摘要
单个全景图从一个摄像头中心捕获完整的视觉范围,但限制用户在适当的位置环顾四周,而无法实现真正的场景探索。将单个全景图转换为持久的、可渲染的 3D 表示以进行自由视点导航已经引起了越来越多的兴趣;现有的方法要么采用迭代的每次视图完成,传播修复结果来更新底层几何,导致渐进的误差积累和繁琐的多步骤管道,要么利用视频生成模型的时间一致性先验,但此类模型固有的连续轨迹约束限制了它们同时覆盖多个方向场景的灵活性。我们提出了 Pano2World,它以单个室内全景图作为输入,并直接输出持久的、可探索的 3D 高斯场景。给定源全景图,Pano2World 首先重建粗略的 3D 高斯代理,并以自适应采样的附近姿势对其进行渲染,以获得几何对齐的引导全景图;然后,全景扩散模型通过视图感知注意路由联合对所有目标视图进行去噪,其中每个目标视图同时接收来自其相应指导全景的几何约束和来自源全景的全局语义指导,自然地强制执行跨视图一致性。为了避免通过 VAE 将联合去噪过程中形成的多视图隐藏特征解码回像素域而产生的信息丢失,我们引入了潜在特征适配器,这是一种几何感知桥接模块,可直接将这些隐藏特征提取为潜在场景,随后解码为最终的 3D 高斯场景。实验表明,Pano2World 在多位置全景小说视图合成基准上显着优于现有方法。