论文

EAD-Net:具有空间细化和时间连贯性的情感感知头部说话生成器

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

应用与实践内容创作

摘要

情感头部视频生成旨在生成具有准确唇形同步和情感面部表情的富有表现力的肖像视频。目前的方法依赖于简单的情感标签,导致语义信息不足。引入高级语义虽然增强了表现力,但很容易导致口型同步退化。此外,主流生成方法难以平衡长视频中的计算效率和全局运动意识,并且时间相干性较差。因此,我们提出了一种基于 \textbf{E}motion-\textbf{A}ware \textbf{D}iffusion 模型的 \textbf{Net} 工作,称为 \textbf{EAD-Net}。我们引入了 SyncNet 监督和时间表示对齐(TREPA)来减轻多模态融合引起的唇形同步退化。为了对长视频序列中复杂的时空依赖性进行建模,我们提出了一种时空方向注意力(STDA)机制,该机制通过条带注意力捕获全局运动模式。此外,我们设计了一个时间帧图推理模块(TFRM),通过图结构学习显式地模拟视频帧之间的时间一致性。为了增强情感语义控制,采用 大语言模型 从真实视频中提取文本描述,作为高级语义指导。 HDTF 和 MEAD 数据集上的实验表明,我们的方法在口型同步准确性、时间一致性和情感准确性方面优于现有方法。