论文

Vorch-IR:长格式统一多模态身份替换视频生成

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

应用与实践内容创作

摘要

视频身份替换旨在转移一个或多个主体的身份,同时保留驾驶视频的运动、表情和时间结构。现有方法主要针对单人设置,并且通常需要特定于任务的结构控制,例如掩模或姿势表示,限制了它们在通用多模式编辑系统中的灵活性。配对训练数据的缺乏进一步限制了多人替换的进展。我们推出了 Vorch-IR,这是一个统一的框架,支持单人和双人身份替换,并在单个模型中提供可选的背景替换。 Vorch-IR 基于 LTX2 构建,以驾驶视频、索引参考图像和文本编辑指令为条件。参考图像不需要与驾驶视频的姿势、布局或空间配置相匹配:它们作为主题或背景参考的角色通过指令指定。密集的视觉条件通过自注意力融合,而视觉语言上下文通过交叉注意力建立语义对应。我们进一步开发了一个自动数据构建管道,该管道综合了所有四种编辑设置的配对监督。使用自动指标和成对人类评估的实验证明了跨不同场景的强大身份保留、运动保真度和时间一致性。时间重叠推理策略另外将短剪辑模型扩展到一分钟长的生成,而无需自回归延续。