论文
乐高:一种用于从外心到自我中心视频生成的免提升方法
LEGO: A Lifting-Free Approach for Exocentric-to-Egocentric Video Generation
摘要
从单个外心记录生成以自我为中心的视频是新颖视图合成的一个具有挑战性的案例,因为两个摄像机几乎没有重叠,并且大部分目标视图是未被观察到的。当前最先进的方法通过估计深度、将视频提升到点云并从以自我为中心的相机重新渲染以调节视频扩散模型来显式重建场景。这种确定性映射将每个像素分配到单个重新投影的位置,这保留了纹理,但将深度错误转换为放错位置的内容。我们询问视频扩散模型应该接收什么作为其条件,并提出了一个无需提升的答案:一个学习的视图合成器,一个经过微调的 LVSM 风格的Transformer,可以直接渲染以自我为中心的视图,而无需深度、点云或重投影,从而在内部解决跨视图对应关系。相反,它的概率映射根据学习到的对应分布对候选源位置上的每个区域进行平均,从而保留结构,同时平均掉精细纹理。我们认为这种权衡适合 扩散生成器,其去噪训练擅长恢复细节,因此有效的条件应该优先考虑结构对齐而不是清晰度。这种分布的集中度还产生每个区域的置信度,既用于掩盖低置信度区域,又用于在早期布局形成去噪步骤期间引导生成器走向高置信度区域。我们的方法始终优于最先进的显式管道,并且无需重新训练即可推广到其他数据集。因此,合成器提供视图结构,而扩散模型则提供其细节。