论文
在推理时稳定相机控制的新视图合成
Stabilizing Camera-Controlled Novel View Synthesis at Inference Time
摘要
无需训练,使用预先训练的视频扩散模型从单个图像进行相机控制的新颖视图合成在大相机运动和长生成视野下通常变得不稳定。现有方法通常结合了多个推理时间组件,因此不清楚哪些设计选择对于稳定性最重要。我们证明稳定性的主要来源很简单。将相机运动分解为小的自回归步骤可以限制每步的几何失真并减少误差累积。一项受控相机步进研究表明,对于小运动,性能保持稳定,并且当每步运动接近 $18$-$20^\circ$ 时,性能下降得更严重。我们进一步评估几何约束的空间注意力和低频外观锚定作为支持细化,以及高效的免配准扭曲管道。在 RealEstate10K 和 MegaScene 中,CamTrol++ 比 无需训练 基线提高了时间和几何一致性、下游 3D 重建质量和生成效率。该方法对于 56 帧生成和显着受控的深度损坏仍然有效。这些结果表明,在推理时仔细控制相机运动可以显着提高相机控制的新颖视图合成的稳定性,而无需重新训练或修改扩散主干。