论文
从以自我为中心的徒步旅行视频生成无人环境演练
Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos
摘要
以自我为中心的“徒步旅行”视频提供了丰富的图像数据源,可以开发世界各地丰富多样的环境视觉模型。然而,由于人群和眼睛水平的摄像机视角,这些视频帧中人类的显着存在削弱了它们在环境建模应用中的有用性。我们专注于通过开发一种生成算法来解决这一挑战,该算法可以真实地从步行游览视频中删除(即修复)人类及其相关的阴影效果。我们方法的关键是构建丰富的视频剪辑对半合成数据集来训练这个生成模型。数据集中的每一对都包含一个仅环境背景剪辑和一个行走人类的复合剪辑,背景上覆盖有模拟阴影。我们从世界各地真实的以自我为中心的徒步旅行视频中随机获取前景和背景组件,以保持视觉多样性。然后,我们使用该数据集对用于对象和效果修复的最先进的 Casper 视频扩散模型进行微调,并证明所得到的模型在从具有大量人类存在和复杂背景的徒步旅行剪辑中去除人类方面,无论在质量上还是在数量上都比 Casper 表现得更好。最后,我们展示了生成的剪辑可用于构建成功的城市位置 3D/4D 模型。