论文

不断变化的同理心强化学习中的支持优先事项

Evolving Support Priorities in Empathetic Reinforcement Learning

模型训练奖励建模与过程监督

摘要

我们发现移情强化学习中存在一个根本性的不匹配:支持优先级随着对话状态而变化,但现有方法通常优化预定义的奖励规范,这些规范在各个回合中保持固定。为了对这些不断变化的支持优先事项进行建模,我们沿着认知、情感和主动同理心组织同理心支持,并提出情境自适应红字演化(CARE)。在每个回合,CARE 都会通过调整这三个共情维度的权重及其细粒度的评估标准来生成上下文自适应的评分标准。通过监督微调和基于偏好的强化学习,使用轮级评分规则监督和人类偏好数据对评分规则生成器进行训练,然后充当在线同理心强化学习的自适应奖励接口。 CARE 与 RLVER 和 MICA 集成,在三位独立LLM评审的指导下,在 SentientBench、EQBench3 和 EMPA 上实现了最先进的性能。值得注意的是,在 EMPA 上,在所有三位评审的评判下,CARE 将 EPM-Idx 比最强基线提高了至少 13 分,其中在 Gemini-2.5-Pro 的评判下从 28.11 提高到 83.54。进一步的分析表明,学习的评分规则优先级会随着对话阶段和用户情绪的不同而系统地变化,这表明 CARE 会随着支持需求的变化而调整奖励内容。