论文

UniSwap:用于对话视频的流式视听身份交换

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

摘要

对话视频角色替换需要协调外观和声音的传输,同时保留源运动、场景、语言内容和音频视频时序。现有方法对两种模式使用单独优化的模型,使得视听一致性难以实现。我们推出 UniSwap,这是第一个用于对话视频中流媒体联合视听身份替换的框架。给定源视频、参考图像和参考语音剪辑,UniSwap 在单个视听扩散 Transformer 内传输参考外观和音色,同时保留源内容和动态。为了解决对齐的跨身份训练对的稀缺问题,我们引入了交换和重建管道,该管道从真实剪辑中删除视觉和声音身份,并使用原始剪辑作为重建目标。从双向骨干网络开始,我们通过用于关节替换的上下文预训练、用于块因果 KV 缓存生成的条件流适应以及用于减轻曝光偏差并将每个块的采样从 30 步减少到 3 步的高效自强制 DMD 逐步调整模型。高效的多 LoRA 交换使三个 DMD 角色能够共享单个冻结骨干网。 Feature-RoPE 分解将缓存的位置保留在训练范围内,支持稳定的长式推理。实验证明了强大的视听同步、竞争性身份保存、高效的流媒体和稳定的长格式生成。