论文
编辑直播!直播统一角色视频编辑
EditaLive! Unified Character Video Editing for Live Streaming
摘要
传统视频剪辑主要关注场景层面的内容,而直播则更注重人物主体。然而,直接将现有的视频编辑方法应用于以人为中心的直播仍然具有挑战性,因为它们可能会引入面部表情不一致,并且通常依赖于多个离线推理步骤,使得它们不适合实时交互。我们提出了 EditaLive,这是一种用于实时流媒体角色视频编辑的新颖框架。具体来说,我们从预训练的图像动画模型(Wan-Animate)开始,它自然地将外观与运动解耦,并将其重新用作基于指令的以人为中心的视频编辑的基本模型,通过收集的 CharEdit-50K 数据集进行参考帧编辑和视频重建。此外,我们将模型从离线双向调整为因果流生成,并设计了一种对齐的自身采样轨迹 蒸馏 策略,将模型压缩为两步采样器,其中固定 RoPE 和对齐强制减少了训练推理差异,并且第一帧保留的稀疏注意力过滤了冗余历史信息以减轻外观漂移。大量实验表明,EditaLive 可提供最先进的编辑性能,忠实保留面部表情和低延迟实时流式推理。