论文
LVSPM:长序列视图合成和姿态估计模型
LVSPM: Long Sequence View Synthesis and Pose Estimation Model
摘要
我们提出了 LVSPM,这是一种通用模型,可以联合估计相机姿势并从未校准的图像集合中合成新颖的视图。仅使用 RGB 图像和姿势监督进行训练,LVSPM 避免了密集的 3D 真值,并采用测试时训练 (TTT) 层无缝扩展到数百个输入视图。在 RealEstate10k、Co3Dv2 和 DL3DV 上,LVSPM 在 16-256 个视图的姿态估计中超越了 VGGT,在严格的阈值下具有特别大的余量。对于更多视图覆盖更大场景的实用协议下的新颖视图合成,LVSPM 实现了最先进的无姿势质量——甚至超越了 PSNR 中的姿势相关模型——并且随着场景规模的增长仍然保持高质量,而基线崩溃。该代码可在 https://burningdust21.github.io/Projects/LVSPM 获取。