论文
VISAFF:以说话人为中心的视觉情感特征学习,用于对话中的情绪识别
VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation
摘要
对话中的情绪识别(ERC)对于有效的人机交互至关重要,旨在识别多轮对话中说话者的情绪状态。早期基于文本的方法难以应对讽刺等复杂场景,因为它们本质上忽略了重要的非语言信息。虽然最近的视觉语言模型 (VLM) 通过直接分析视频来解决这个问题,但它们本质上并不是针对 ERC 量身定制的,并且通常关注与情感无关的背景区域或被动听众,而不是主动发言者。此外,微调 这些大型模型会产生高昂的计算成本。此外,如果没有语言内容和声音韵律的上下文,孤立的视觉信号经常是模棱两可的或技术上受到损害的。为了应对这些挑战,我们提出了 VISAFF,一个以说话者为中心的 ERC VISual AFFective 特征学习框架。 VISAFF 包括两个阶段:以说话者为中心的情感基础和可靠性引导的情感补充。 VISAFF 利用免调音方法来解锁冻结 VLM 的推理能力,有效引导它们专注于当前发言者的情感视觉线索,而无需繁重的训练开销。在第二阶段,我们引入了一种以可靠性为导向的情感互补机制,动态地利用文本和声学模式来补偿视觉不确定性。对两个真实世界数据集的实验表明,与免调整设置中最先进的方法相比,VISAFF 实现了极具竞争力的性能,通过消除对大型 VLM 的昂贵 微调 的需求,显着提高了计算效率。源代码可在 https://anonymous.4open.science/r/speaker-2365/ 获取。