论文

倾听回声:基于标量—言语混合强化学习的用户反应感知策略优化

Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning

模型训练强化学习

摘要

当前情感支持对话系统在对齐时通常依赖专家定义的标量奖励,但这些信号存在严重的信息稀疏性。它们无法解释某个回复为何失败、也无法说明如何适应动态变化的用户状态,往往偏离促进积极情绪转变这一实际目标。在实践中,最直接、最可靠的学习信号来自用户在持续交互过程中的连续反应。因此,我们提出反应感知策略优化(Reaction Aware Policy Optimization, RAPO),一个以交互后果而非评分细则为优化对象的框架。RAPO将对话视为由反应驱动的过程,并利用模拟用户响应生成密集的自然语言反馈,其核心包含三个组件:事后对话选择(Hindsight Dialogue Selection),用于分离出真正改变用户情绪轨迹的关键轮次;生成式事后反馈(Generative Hindsight Feedback),将用户反应转化为对比排序信号与自然语言批评;以及标量—言语混合策略优化(Scalar-Verbal Hybrid Policy Optimization),将用于全局对齐的标量奖励优化与用于细粒度语义精炼的言语反馈蒸馏相耦合。在ESC和Sotopia上的大量实验表明,RAPO在促成积极交互结果方面显著优于强强化学习基线。

倾听回声:基于标量—言语混合强化学习的用户反应感知策略优化:论文配图
图1:对比以专家为中心的标量奖励与感知用户反应的混合奖励,后者将用户反馈信号引入策略优化。