论文

EchoChat:同理心口语对话中的结构化认知推理

EchoChat: Structured Cognitive Reasoning in Empathetic Spoken Dialogue

模型训练强化学习

摘要

同理心的口头对话是一个复杂的认知过程,不仅需要识别情绪,还需要推断用户的潜在心理状态以提供适当的支持。然而,当前的 SpeechLLM经常将同理心视为直接输入到响应的映射,导致“表面上温暖”但情感上空洞的互动。此外,由于同理心依赖于具有强烈步骤间依赖性的多阶段过程,任何中间步骤的错误都可能级联到后续步骤并导致不适当的响应,而现有的训练范式缺乏精确定位和改进此类错误的机制。在这项工作中,我们提出了 EchoChat,这是一个统一的框架,它将同理心口语对话重新表述为集成感知、心理状态推理和响应生成的结构化认知推理过程。为了支持这种范例,我们首先构建了 EchoDialogue-400K,这是一个用于多阶段共情监督的丰富声学数据集。在 SFT 阶段,我们通过提出的声学锚定注意力(AAA)来加强声学视觉定位。在强化学习阶段,我们进一步引入了一种新颖的阶段感知优化目标和逐步分解信用分配(SDCA),以定位推理错误并减轻级联错误传播。此外,我们还推出了 EchoEval,这是一个专家注释的多维同理心评估基准。大量实验表明,EchoChat 在感知、推理和响应对齐方面实现了最先进的性能。项目页面:https://github.com/dingdongwang/EchoChat

EchoChat:同理心口语对话中的结构化认知推理的原论文方法或结果图
图 1:将同理心对话重新定义为结构化认知推理。现有方法将同理心简化为直接响应生成,导致中间阶段出现级联推理错误。相反,EchoChat 将同理心建模为从感知到响应的结构化过程,并得到 EchoDialogue-400K 和 EchoEval 的支持,从而实现基于认知和情感一致的语音交互。