论文

通过可验证的情感反馈实现多轮同理心对话的双环自我进化

Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue

模型训练强化学习

摘要

大语言模型 已经展示了对话能力,但同理心能力仍然具有挑战性。同理心支持本质上是多轮次和路径依赖的:用户逐渐表达担忧,情绪随着时间的推移而变化,早期的反应塑造信任和接受度。具有可验证情感奖励的强化学习为长期交互提供了可扩展的监督。然而,现有方法在保持其训练交互分布固定的同时不断发展对话政策,从而导致政策能力和训练经验之间不匹配。我们引入了由可验证的情绪反馈驱动的双环自我进化框架。在用户模拟器和验证器冻结的情况下,内循环使用连续的情感奖励来优化多回合策略,而外循环使用相同的结果来估计策略相关的交互效用并适应体验。为了从稀疏、随机的执行轨迹中获得估计,该框架使每个组内的场景和交互状态保持不变,并优先考虑组通过率接近策略能力边界的条件。分层控制器在支持意图之间共享证据,而不确定性引导的探索和统一的演练可以防止过早的排除。由此产生的分布会生成轨迹,从而在不增加轨迹采样预算的情况下关闭两个循环。在 SAGE 上,我们的框架将 Qwen3-8B 总体得分从 53.87 提高到 79.24,比协议匹配的统一情感奖励强化学习高出 7.23 分。