论文

比较推理:使音频语言模型更好地比较情感

Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

模型训练监督微调与指令调优

摘要

大型音频语言模型(LALM)可以对音频进行推理,但目前尚不清楚它们是否可以在情感、环境、语言、韵律和人际维度上对两个语音信号进行比较判断。我们在语音情感识别 (SER) 的背景下研究这个问题,其中模型确定哪种话语表现出更高的唤醒度、效价或优势。我们引入了一个推理引导的序数 SER 框架,该框架在成对语音输入上调节 LALM。该模型使用从语义音频描述和源自 GeMAPS 特征的声学证据生成的推理轨迹进行训练,从而实现可解释的比较决策。除了直接监督之外,我们还采用直接偏好优化来鼓励对情感差异进行更强烈的分离。实验表明,所提出的框架改进了偏好预测,同时只需要传统序数 SER 系统使用的训练数据的 5%。