论文

InfinityEdit:使用轻量级 Edit-Ignition 适配器进行无限视频编辑

InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter

模型架构Transformer

摘要

通过大型预训练模型,现有方法有效改进了基于指令的视频编辑。然而,它们中的大多数依赖于就地编辑假设。他们在固定的时间跨度内将编辑后的视频与给定的源剪辑逐帧对齐。此模式不适用于开放式流,例如重新设计实时游戏或将摄像机移动应用于正在进行的镜头。在这种情况下,编辑必须扩展到未来帧到达时,而不是应用于静态输入剪辑。在本文中,我们研究了这种设置并将其命名为无限视频编辑:给定前面的片段和编辑请求,模型必须生成下一个片段,在应用请求的编辑时继续流。当无限的编辑指令序列到达时,这个过程就会重复。这项任务带来了两个挑战:编辑必须是忠实的延续,而不是逐帧重写,并且随着编辑的积累,生成质量必须保持稳定。为了解决这些问题,我们首先设计了一个用于无限视频编辑的数据收集管道。根据收集的数据,我们提出了 InfinityEdit,这是一种轻量级编辑适配器,为流视频生成器配备了无限的编辑能力。该适配器包含三个注意力模块。历史交叉注意力使用输入帧指导去噪帧。时间因果自注意力使时间线索仅从较早的帧流向较晚的帧。编辑交叉注意力将编辑请求注入到生成中。在推理期间,适配器仅在编辑请求到达的块中被激活。后续块由具有重置锚框的原始模型生成。该方案在应用编辑的同时保留了原始模型的无限生成能力。大量实验表明,InfinityEdit 在每次编辑下忠实地继续流,并在无限制的编辑序列上保持稳定。