论文
ESCRAG-R1:面向情感支持对话的检索增强强化学习
ESCRAG-R1: Retrieval-Augmented Reinforcement Learning for Emotional Support Conversation
摘要
情感支持对话(ESC)系统旨在通过平衡专业治疗能力与自然共情来提供整体性支持。然而,现有方法难以同时实现结构化的、阶段感知的推理与共情-专业知识的无缝对齐,往往导致临床策略与泛泛安慰的人为拼接。为克服这些局限,我们提出ESCRAG-R1,一个将基于检索的心理引导融入GRPO(组相对策略优化)的统一框架。通过将检索引入强化学习循环,ESCRAG-R1将外部知识转化为稳健的学习信号,激发生成前的显式内部推理,并从根本上重塑模型的内部策略。为提供这一优化所需的可靠监督,我们构建了ESC-Preference,一个基于来访者-咨询师-评判者评估框架的高质量数据集,可提供精确的、共情感知的奖励信号。大量实验表明,ESCRAG-R1通过缓解表面拼接、实现专业引导与共情表达的自然融合,显著优于现有基线。代码与数据集已发布于 https://github.com/Matcha-Liu/ESCRAG-R1。
