论文

ARGUS:用于生成主题保留视频的堆叠多视图身份马赛克注入

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

应用与实践内容创作

摘要

保留主题的视频生成并不能仅通过正面相似性来解决:生成的人物必须在运动、大视点变化、表情变化、遮挡、尺度变化以及文本、第一帧和身份参考之间的冲突中保持可识别性。我们认为,核心瓶颈是点参考范式,它将身份分解为与姿势、配件、照明、背景和相机统计数据纠缠在一起的单个静态观察。我们介绍 Argus,一个基于 Wan 的框架,以堆叠多视图身份马赛克注入 (SMII) 为中心。 SMII将MLLM选择的图像/视频身份证据转换为3*3堆叠的马赛克,将马赛克与当前扩散时间同步,并将其作为负时间只读存储器注入到Wan的原生词元空间中。这将身份从外部干净适配器或单个参考图像转变为紧凑的动态分布。围绕 SMII,MLLM 身份总监选择信息丰富的身份时刻并解决条件冲突,而无交叉配对反事实训练、时间身份退火和自适应自相似指导则在没有配对主题视频监督的情况下提高了鲁棒性。我们进一步发布了 HardID-Celeb,一个公众人物身份压力基准,并引入了 YawScore 和 OccScore 来探测大偏航和第一帧遮挡的鲁棒性。 Argus 在 OpenS2V-Eval Human-Domain 上取得了最先进的成绩,总分达到 64.38、FaceSim 71.86、NexusScore 51.62 和 NaturalScore 79.14。在 HardID-Celeb 上,Argus 获得了 76.80 FaceSim,并将 YawScore 和 OccScore 比最强基线提高了 12.60 和 15.10 分,这表明动态身份记忆和大规模反事实自我监督对于主题保留视频生成非常有效。