CLIP-AUTT:测试时个性化,带有提示细粒度视频情感识别的动作单元
CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition
摘要
情绪识别 (ER) 中的个性化对于准确解释微妙和特定主题的表达模式至关重要。视觉语言模型 (VLM)(例如 CLIP)的最新进展证明了在 ER 中利用联合图像文本表示的巨大潜力。然而,现有的基于 CLIP 的方法要么依赖 CLIP 的对比预训练,要么使用 LLM 生成描述性文本提示,这可能会产生噪音、计算成本高昂,并且通常无法捕获细粒度的表达式,从而导致性能下降。在这项工作中,动作单元 (AU) 被用作 CLIP 中的结构化文本提示,以对细粒度的面部表情进行建模。 AU 对表情底层的微妙肌肉激活进行编码,为更强大的面部表情识别 (FER) 提供本地化和可解释的语义线索。我们引入了 CLIP-AU,这是一种轻量级的 AU 引导的时间学习方法,它将可解释的 AU 语义集成到 CLIP 中。它通过将 AU 提示与面部动态对齐来学习通用的、与主题无关的表示,从而无需 CLIP 微调 或 LLM 生成的文本监督即可实现细粒度的 FER。尽管 CLIP-AU 建模了细粒度的 AU 语义,但它并不适应微妙表达中特定于主题的变化。为了解决这个限制,我们提出了 CLIP-AUTT,一种基于视频的测试时个性化方法,可以动态地将 AU 提示适应来自未见过的受试者的视频。通过将熵引导的时间窗口选择与即时调整相结合,CLIP-AUTT 能够在保持时间一致性的同时实现特定于主题的适应。我们对三个具有挑战性的基于视频的数据集 BioVid、StressID 和 BAH 进行的实验表明,CLIP-AU 和 CLIP-AUTT 优于最先进的基于 CLIP 的 FER 和 TTA 方法。