论文
大型音频语言模型中的多语言情感神经元
Multilingual Emotion Neurons in Large Audio-Language Models
摘要
情感是人类交流的核心,其表达方式因语言而异。大型音频语言模型(LALM)在多语言语音任务上取得了出色的性能,但仍不清楚它们是否通过特定于语言的相关性或与语言无关的表示来编码情感。我们提出了这个问题的第一个神经元水平的可解释性研究。我们将多语言情感神经元(MLEN)定义为表现出稳定的情感选择性和跨语言的一致因果效应的功能单元,并引入一致性正则融合(CR-Fusion)来识别它们。在四种现代 LALM 和 12 种不同类型的语言中,每种语言独立识别的情绪敏感神经元显示出最小的重叠,并且额外的单语识别数据很快饱和,而无需隔离更多可转移的单元,从而激发了从汇集的跨语言证据中进行识别。因果干预表明,在零样本和低资源环境中,CR-Fusion 识别的 MLEN 比单语言神经元集提供更精确和可转移的情感控制。留一消融进一步揭示了不对称迁移:个体识别语言,包括低资源语言,提供非冗余证据,而几种低资源语言从由此产生的跨语言迁移中受益最多。总之,我们的研究结果提供了 LALM 如何跨语言编码情感的第一个因果、神经元级别的解释,并将多语言神经元识别建立为理解跨语言情感行为的有效机制。