论文
用于保留语音的面部表情操作的个性化跨模态情感相关学习
Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation
摘要
保留语音的面部表情操纵(SPFEM)旨在增强人类的表达能力,而不改变与原始语音相关的嘴部运动。该领域的主要挑战是配对数据的稀缺,即同一个人具有相同语音但不同表达的对齐框架,这阻碍了对情绪操纵的直接监督。虽然当前的视觉语言模型(VLM)可以提取一致的视觉和语义特征,使它们成为有前途的监督来源,但它们的直接应用是有限的。为此,我们提出了一种个性化跨模态情感相关学习(PCMECL)算法,通过两项重大改进完善了基于 VLM 的监督。首先,标准 VLM 依赖于针对每种情绪的单一通用提示,无法捕捉个体之间的表达差异。 PCMECL 通过调节个人视觉信息来学习个性化提示,从而建立更细粒度的视觉语义相关性,从而解决了这一限制。其次,即使有了个性化,视觉和语义特征分布之间仍然存在固有的差异。为了弥补这种模态差距,PCMECL 采用特征差异来关联模态,通过将视觉特征的变化与语义特征的变化相匹配来提供更精确的对齐监督。作为即插即用模块,PCMECL 可以无缝集成到现有的 SPFEM 模型中。跨各种数据集的广泛实验证明了我们算法的卓越功效。