论文
Avatar V:缩放视频-参考 Avatar 视频生成
Avatar V: Scaling Video-Reference Avatar Video Generation
摘要
生成不仅在视觉上与目标个体相似而且在行为上可识别的化身视频,忠实地再现他们的说话节奏、手势倾向和表情动态,仍然是一个开放的挑战。现有方法主要以单个静态图像为条件,这些图像提供的身份信息不足,并且无法捕获动态运动特征,而标准像素级目标无法满足决定头像保真度的感知关键面部区域。我们提出了 Avatar V,一个生产规模的框架,它通过视频参考条件身份建模来解决这些限制。该模型不是将身份压缩为固定大小的嵌入,而是直接以参考视频的完整标记序列为条件,通过对参考上下文的关注来学习重现静态身份属性(面部几何形状、皮肤纹理)和动态行为模式(说话节奏、微表情)。我们引入稀疏参考注意,这是一种非对称机制,可在任意长的参考上实现线性复杂度调节;运动表示流,支持闭环谈话风格转换;以及继承完整参考调节的身份感知超分辨率精炼器。这些由一个数据引擎提供支持,该数据引擎从 50M 原始视频中整理 100M+ 训练剪辑,以及一个五阶段训练管道,具有流匹配 预训练、个性 微调、两阶段 蒸馏(>10 倍加速)和 RLHF 对齐,部署在数千个 GPU 上。 Avatar V 生成无限时长的 1080p 视频,在我们的跨场景基准测试中实现了最先进的身份保存、口型同步和生成质量,在自动指标和人工评估方面始终优于包括 Seedance 2.0、Kling O3 Pro、Veo 3.1 和 OmniHuman 1.5 在内的领先系统。