论文

GroupVideo:多身份定制文本转视频生成

GroupVideo: Multi-Identity Customized Text-to-Video Generation

应用与实践内容创作

摘要

当前的身份定制视频生成方法主要局限于单一身份场景,因为缺乏明确的身份分离机制往往会导致多身份环境中的身份混淆。现有的多身份方法通过连接人脸图像作为输入条件来直接扩展单身份框架,经常导致不自然的面部表情和动作,表现为“复制粘贴”现象。为了克服这些限制,我们引入了 GroupVideo,这是一种新颖的框架,它利用多张单独的照片来生成身份定制视频。 GroupVideo 基于 Video Diffusion Transformer 构建,融合了多模态身份对齐:视觉对齐联合编码多个人脸图像以提供强大的身份参考,而语义对齐则引入语义感知器以增强运动的自然度。引入具有空间引导的身份定位模块来解决身份混合并增强身份保真度,以及边界框约束和掩模正则化损失,以专注于面部区域并提高训练效率。针对多 ID 视频数据集的短缺,我们整理了包含 20,000 个视频的综合高质量数据集,从而为推进多 ID 视频生成的未来研究奠定了重要的资源。大量实验表明,GroupVideo 在生成具有一致身份和自然动作的多角色视频方面优于现有方法。