论文
一种视图就足够了:用于新视图生成的野外单眼预训练
One View Is Enough: In-the-Wild Monocular Pretraining for Novel View Generation
摘要
单目新颖视图合成长期以来需要多视图图像对进行监督,从而将训练限制在一组狭窄的专用数据集上。我们提出野外单目预训练:冻结深度估计器将每个源图像提升为 3D 并在采样姿势下重新投影以产生伪目标视图;隐蔽损失将监督限制在有效区域,而对抗性目标则覆盖了被遮挡的区域。扩展到 3000 万张未整理的图像,这会生成 OVIE,在推理时只需要源图像和目标姿势。先前的工作在没有多视图数据的情况下进行训练,但在推理时需要深度估计器,或者放弃这种依赖性但需要多视图训练对; OVIE 是第一个两者都不需要的。在没有多视图监督的情况下,OVIE 可以与 RealEstate10K 上的域内基线相媲美,并超越 DL3DV 上的所有基线,产生任何无几何方法中多视图一致的轨迹;简短的多视图 微调 在其训练领域优于所有无几何方法。在 116 FPS 下,它比最快基线快 600 倍以上。代码和预训练模型位于 https://github.com/kyutai-labs/ovie;视频结果位于项目页面上,https://kyutai.org/blog/2026-04-14-ovie/。