论文
从同步到序列:通过插值生成 Exo-to-Ego
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
摘要
Exo-to-Ego 视频生成旨在从同步的第三人称视图和相应的相机姿势合成第一人称视频。虽然可以使用配对监督,但同步的外自我数据本质上会引入大量的时空和几何不连续性,违反了标准视频生成基准的平滑运动假设。我们将这种同步引起的跳跃视为核心挑战,并提出了 Syn2Seq-Forcing,这是一种在源视频和目标视频之间进行插值以形成单个连续信号的顺序公式。通过将 Exo2Ego 重新构建为顺序信号建模而不是传统的条件输出任务,我们的方法可以实现基于扩散的序列模型,例如扩散强制 Transformer (DFoT),更有效地捕获跨帧的连贯过渡。根据经验,我们表明仅对视频进行插值而不执行姿势插值已经产生了显着的改进,强调主要困难来自时空不连续性。除了立即提高性能之外,该公式还建立了一个通用且灵活的框架,能够将 Exo2Ego 和 Ego2Exo 生成统一在单个连续序列模型中,为跨视图视频合成的未来研究提供原则基础。