论文
ER-EDF:一种基于心理学的语音共情对话生成框架,用于大音频-语言模型
ER-EDF: A Psychology-Grounded Emotion Regulation Framework for Speech Empathetic Dialogue Generation in Large Audio-Language Models
摘要
语音对话系统中的共情响应生成需要准确的情感感知和恰当的情感调节。基于感知-行动模型和情感调节理论,有效的共情不仅依赖于推断用户的情感状态,还依赖于调节其在响应中的表达方式。然而,近期的大规模音频-语言模型(LALMs)大多将情感视为直接的条件信号,缺乏明确的调节机制,常导致情感镜像而非恰当支持。我们提出ER-EDF,一种基于心理学的框架,明确在LALMs中解耦情感感知与情感调节。感知追踪用户的情感状态,而调节决定该状态应如何引导共情响应生成。该框架模型无关,可无缝集成到现有LALMs中。我们进一步构建了一个语音共情对话数据集,并引入超越词汇匹配的共情感知评估指标。在五个LALMs和两个数据集上的实验表明,ER-EDF在自动和人工评估中均显著提升共情响应质量,凸显了在语音共情对话系统中联合建模情感感知与调节的重要性,为心理基础的共情AI开辟了新方向。
