论文

SocialRL:通过多轮强化学习和奖励设计完善LLM的社交智能

SocialRL: Refining LLMs' Social Intelligence through Multi-turn Reinforcement Learning and Reward Design

模型训练强化学习

摘要

社交智能使代理能够读取社会背景、推断意图并适应持续的对话。随着语言模型成为自主协作者,它对于建立有效且值得信赖的人机交互至关重要。现有的强化学习方法优化了单轮话语和稀疏的结果奖励,产生了难以管理多轮交互中目标关系紧张的短视政策。我们提出了 SocialRL,这是一个解决这两个挑战的多轮强化学习框架。首先,我们使用 PPO 来应用多回合强化学习,将延迟的结果奖励传播回每个回合,从而实现长期规划。其次,我们设计了六个过程奖励维度来捕捉目标与关系的权衡,包括目标推进、关系协调、上下文连贯性等。奖励模型动态地为每个维度生成细粒度的评分标准,而阶段感知权重计划优先考虑早期的关系建立、中途的目标推进和后期的平衡关闭。在多个社交对话基准中,SocialRL 比相应的基础模型平均提高了目标成就 9.2 个百分点。这些结果证明了 SocialRL 在合成和真实社交场景以及标准和具有挑战性的社交场景中的有效性。