论文

ARGen:基于视觉的动态情绪感知的情感强化生成增强

ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception

模型训练合成数据

摘要

由于数据稀缺和长尾分布,野外动态面部表情识别仍然具有挑战性,这阻碍了模型有效学习稀缺情绪的时间动态。为了解决这些限制,我们提出了 ARGen,一种情感强化生成增强框架,能够生成数据自适应动态表达,从而实现稳健的情绪感知。 ARGen 分两个阶段运行:情感语义注入 (ASI) 和自适应强化扩散 (ARD)。 ASI阶段通过面部动作单元建立情感知识对齐,并采用检索增强提示生成策略,通过大规模视觉语言模型合成一致且细粒度的情感描述,从而将可解释的情感先验注入到生成过程中。 ARD阶段将文本条件图像到视频扩散与强化学习相结合,引入帧间条件指导和多目标奖励函数,共同优化表情自然度、面部完整性和生成效率。对生成和识别任务的大量实验验证了 ARGen 显着增强了合成保真度并提高了识别性能,为基于视觉的情感计算建立了可解释和可推广的生成增强范例。