论文

多轮共情对话中的话语多样性

Discourse Diversity in Multi-Turn Empathic Dialogue

模型训练强化学习

摘要

大语言模型 (LLM) 在单轮设置中产生被评为高度共情的响应(Ayers et al., 2023; Lee et al., 2024),但它们也被认为是跨任务重用相同词汇模式、句法模板和话语结构的公式生成器(Jiang et al., 2025; Shaib et al., 2024; Namuduri 等人,2025)。人们很少关注这种公式化是否延伸到话语动作的层面,即回应对所针对的人有何作用。这个问题对于移情对话尤其重要,在这种对话中,有效的支持不仅需要在某一时刻做出善意的回应,还需要随着对话的展开而采取不同的策略(Stiles 等,1998)。事实上,之前的研究表明,LLM 在单回合设置中比人类支持者更多地重用相同的战术序列(Gueorguieva 等人,2026)。我们将此分析扩展到多回合对话,发现刚性复合:一旦策略出现在支持者回合中,LLM 就会在下一个回合中重用它,其速度几乎是人类的两倍(0.50-0.56 vs. 0.27)。这种模式适用于在真实情感支持对话中充当支持者的 LLM,并且对于标准相似性度量是不可见的。为了解决这一差距,我们引入了 MINT(多轮策略间新颖性训练),这是第一个强化学习框架,用于优化多轮移情对话中的话语移动多样性。最好的 MINT 变体将同理心质量奖励与跨回合策略新颖性信号相结合,在 1.7B 和 4B 模型中将总同理心提高了 25.3%,同时在 4B 模型上将跨回合话语移动重复减少了 26.3%,在两项指标上都超过了所有基线,包括仅质量方法和 词元级 多样性方法。这些结果表明,当前模型缺乏的不是同理心本身,而是在对话中改变话语的能力。