论文

超越文本:基于大语言模型的多模态对话中的维度情感评估

Beyond Text: LLM-Based Dimensional Emotion Evaluation in Multimodal Dialogue

模型训练监督微调与指令调优

摘要

对话中的情绪识别已被广泛研究,但将大语言模型(LLM)应用于多模态对话中的连续维度情绪评估仍然很大程度上尚未被探索。我们提出了一个基于 LLM 的框架,该框架在 IEMOCAP 上执行离散情感识别和效价-唤醒-优势 (VAD) 维度评估,并遵循 SpeechCueLLM 方法将声学线索合并为自然语言描述。我们在零样本提示、少样本提示和 LoRA 微调下评估了涵盖 LLaMA、GPT 和 Qwen 系列的六种模型。尽管 GPT 规模更大,但 LoRA 微调的 LLaMA 模型在这两项任务上的表现均明显优于即时设计的 GPT 模型,我们将这一差距归因于领域适应而不是模型容量。我们的最佳模型的价 CCC 为 0.7822,这是 IEMOCAP 上的最新技术。消融研究证实,文本音频描述可以有效地改善较小的模型(+3.5 至 3.6 加权 F1),而对最大的模型贡献很小,这表明当语言能力有限时,音频提示最有价值。 VAD 维度上的性能不对称密切反映了 IEMOCAP 自己的注释中的注释器协议层次结构。