论文

ALIVE:首帧引导的交互一致视频对象插入

ALIVE: Interaction-Aligned Object Insertion for First-Frame-Guided Video Editing

模型训练合成数据

摘要

当前的视频编辑器可以插入对象,但通常很难让它们参与交互,例如被拾取或操纵。我们引入了 ALIVE,一个框架,它使用编辑后的第一帧和仅命名添加对象的指令,通过与源视频内容的连贯交互使插入的对象“活跃”。我们策划了 35,800 个编辑对,将 3D 渲染、模型生成和真实世界的视频与 ROSE 的一般编辑对相结合。每对目标对象的存在都不同,同时保留了周围的动作,教导编辑者协调对象行为和源保存。我们进一步训练视觉语言模型(VLM)来预测来自相同输入的交互指导。我们引入了 ALIVE 交互基准,使用基于 VLM 的统一协议来评估交互保真度、源保留和视觉连贯性,并在通用视频对象插入基准上进行评估。在没有 VLM 指导的情况下,ALIVE 在两个基准上的整体性能比最强评估基准分别提高了 43.9% 和 4.4%。 VLM 预测指导进一步将 ALIVE 交互得分提高了 0.95 分,无需额外的用户输入。

ALIVE:首帧引导的交互一致视频对象插入:论文原图
图 3:ALIVE 概述。 (a) 源和噪声目标 潜变量 是通道级联的 (C);编辑后的第一帧潜在图像保持干净(金色)。火焰标记编辑器和 VLM LoRA 微调。 (b) 有监督的 VLM 根据相同的视觉输入和 P1 预测 P4 描述和间隔。 P4 文本是独立编码的。注意力图将共享 P0-P3 与时间局部 P4 调节进行对比。