论文
PE-Field 4D:视频生成模型作为画布
PE-Field 4D: Video Generation Models as Canvas
摘要
Diffusion Transformer 最近在视频生成方面取得了强大的性能,但在视点变化和相机运动下控制场景几何形状仍然具有挑战性。在这项工作中,我们重新审视了位置编码在视频扩散 Transformer 中的作用,并表明它为几何感知控制提供了有用的空间偏差。具体来说,如果参考标记根据其在目标视图中的投影位置进行编码,则鼓励去噪模型从输入视频的位置对齐区域检索内容。基于这一观察,我们引入了一种几何感知交叉注意机制,使目标视频潜在标记能够关注从参考图像或帧派生的结构化上下文标记。为了建立参考内容和目标相机轨迹之间的对应关系,我们为上下文标记配备了投影位置编码方案,该方案将目标视图 2D 重投影与深度感知消歧相结合。同时,我们保留了生成的视频潜在的原始时空位置编码,允许注入几何引导,同时保持与视频模型的本机潜在结构的一致性。由此产生的框架为可控视频生成提供了一种简单有效的方法。它提高了视点相关编辑任务的空间可控性,包括摄像机重新轨迹、新颖视图视频合成和几何感知视频编辑,同时保留底层视频扩散模型的生成先验。该代码位于:https://github.com/MTLab/PE-Field。