论文

Edit-VAR:驯服视觉自回归模型以实现精确视频编辑

Edit-VAR: Taming Visual Autoregressive Model for Precise Video Editing

模型推理解码与生成控制

摘要

文本引导视频编辑修改目标内容,同时保留未编辑区域的外观和时间连贯性。基于训练的方法提供了强大的控制,但需要大量的数据和计算。免训练方法分为免反演和基于反演的范式。无反转方法避免了轨迹恢复,但其源保留指导可能会限制编辑强度并使语义更改不完整。基于反演的方法在再生之前恢复潜在轨迹,其中近似误差可能累积并导致源内容漂移和时间不一致。我们推出了 Edit-VAR,这是第一个使用预训练的视觉自回归视频模型进行文本引导视频编辑的免训练和免反转框架。 Edit-VAR 直接将源视频编码为多尺度离散词元,并执行概率引导的条件词元替换以保存源。注意力引导的标记明智和规模感知调制有选择地放松了对编辑相关位置和生成阶段的源约束。尺度解耦生成以后期尺度约束释放的形式实现,可重新生成运动一致的细节并减少纹理碎片。残差引导的词元修剪进一步利用最后两个高分辨率尺度的冗余来降低推理成本。大量实验和盲用户研究表明,Edit-VAR 在编辑保真度、源保存、时间一致性和推理效率方面总体优于现有的免训练视频编辑方法。