论文

用于语音情感识别的音频语言模型中的声学提示对齐

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

模型评测模型行为与机制分析

摘要

可以通过明确的声学提示来增强遵循指令的音频语言模型(ALM),但尚不清楚当原始音频已经可用时是否以扎实的方式使用这些提示。我们通过从标准化 eGeMAPS 副语言特征集中派生出六个可解释的声学概念标记来研究语音情感识别 (SER) 中的这个问题。这些标记总结了能量、音高、动态、亮度、共振峰和语音质量,并附加到文本提示中,同时音频输入保持不变。在广泛使用的 FAU-Aibo 和 IEMOCAP 基准中,对齐的词元可以提高未加权平均召回率 (UAR),而打乱、冲突或损坏的词元会降低相对于对齐词元的性能,并将混乱转向中性。重要的是,预测在强烈的词元扰动下不会崩溃,这表明模型对符号提示通道敏感,但仍部分锚定于音频信号。我们认为,仅词元干预提供了一种实用的方法来探索基于 ALM 的情感计算中基于音频的提示的使用、稳健性和可解释性。