论文

EgoPlay:以自我为中心的流的事件触发视频编辑

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

应用与实践内容创作

摘要

我们介绍 EgoPlay,这是一种用于以自我为中心的流的事件触发视频到视频编辑器,由 微调 获得,预训练的 V2V 扩散 Transformer 主要基于 Ego4D 构建的事件条件数据。给定单眼视频和“当 X 发生时,执行 Y”形式的事件触发提示,EgoPlay 会推断事件 X 是否以及何时发生,保留事件前帧,并将编辑 Y 仅应用于事件后延续。 EgoPlay 不是将单独的事件检测器与编辑器级联,而是在单个端到端模型中联合学习事件识别、时间约束和像素级编辑,同时还处理负面提示和多事件提示。为了支持这一点,我们构建了一个包含 106K 个事件触发剪辑提示对的大型数据集,涵盖正触发、虚构触发负和多事件提示。然后,我们训练具有事件触发监督的双向视频扩散编辑器,并导出逐块流式推理的因果变体。我们进一步引入了一种事件感知评估协议,该协议分别测量触发后编辑质量、触发前保存和错误触发鲁棒性。在 Ego4D 基准测试中,EgoPlay 大幅优于 EgoEdit(最先进的基于指令的自我中心视频编辑基准),在编辑质量、视觉质量和背景一致性方面相对提高了 17.7%、16.9% 和 16.4%。在相同指标上,它还比 VLM 引导的检测器编辑器基线高出 15.7%、14.5% 和 13.5%,同时使用的 GPU 内存还不到一半。