论文
跨言语和面部的情感:多模态基础模型中的共享情感机制
Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models
摘要
现代多模态基础模型 (MFM) 在需要跨语音、视觉和语言的综合感知的任务(包括情感识别)方面取得了快速进展。然而,目前尚不清楚它们是否通过共享的情感功能单元或特定模式的途径来识别言语和面部情绪。我们在三个 MFM 中探索情绪敏感神经元 (ESN),即与情绪类别选择性相关的稀疏解码神经元:Gemma-4-12B-it、MiniCPM-o-4.5 和 Qwen2.5-Omni-7B。使用语音情感识别和面部表情识别作为互补探针,我们识别声学和视觉 ESN。视觉 ESN 具有因果意义:选择性地停用它们会损害对相关面部情绪的识别,而控制它们的激活会选择性地增强对该情绪相对于其他情绪类别的识别。声学和视觉 ESN 进一步显示出情感匹配的重叠和类似的分层分布,表明语音和面部情感表征之间的部分结构对齐。最后,跨模式干预揭示了双向因果转移:从一种模式识别出的 ESN 在应用于另一种模式时会产生特定于情绪的效果。我们的研究结果提供了 MFM 中情感功能单元的第一个跨模态激活水平分析,表明语音和面部情感识别部分收敛到稀疏解码器级组件上,这些组件可以在无需训练的情况下进行本地化和操作。