论文

STRIDE-ED:用于移情对话系统的基于策略的逐步推理框架

STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems

模型训练强化学习

摘要

同理心对话不仅需要识别用户的情绪状态,还需要在整个响应生成过程中做出策略意识、上下文敏感的决策。然而,缺乏全面的共情策略框架、明确的任务对齐多阶段推理和高质量的策略感知数据从根本上限制了现有方法,阻碍它们有效地将共情对话建模为复杂的、多阶段的认知和决策过程。为了应对这些挑战,我们提出了 STRIDE-ED,这是一个基于策略的、可解释的、深度推理框架,通过结构化、策略条件推理来模拟同理心对话。为了支持有效的学习,我们开发了一个策略感知的数据细化管道,集成了基于 LLM 的注释、多模型一致性加权评估和动态采样,以构建与同理心策略一致的高质量训练数据。此外,我们采用两阶段训练范例,将监督 微调 与多目标强化学习相结合,以更好地将模型行为与目标情绪、同理心策略和响应格式结合起来。大量实验表明,STRIDE-ED 可以推广到各种开源 LLM,并且在自动指标和人工评估方面始终优于现有方法。我们的数据和代码可在 https://github.com/jicoder-nwpu/STRIDE-ED 上公开获取。