论文

PB-GRPO:通过偏好分批 GRPO 学习社会适应型 LLM 智能体

PB-GRPO: Learning Socially Adaptive LLM Agents from Persona-Driven Simulation with Preference-Batched GRPO

模型训练强化学习

摘要

构建在社交方面表现良好(而不仅仅是正确)的 LLM 需要构建在社交方面表现良好(而不仅仅是正确)的 LLM,需要的不仅仅是产生本地有用的响应。具有社交能力的智能体必须推断用户未明示的目标,尊重他们的偏好,并随着对话的展开而适应。这些行为本质上是多轮和社交的,使得它们难以优化:真实的交互数据稀缺,用户偏好通常是潜在的而不是直接观察到的。为了应对这些挑战,我们构建了一个角色驱动的社交模拟环境(由角色库、基于 LLM 的用户模拟器和范围从 [0, 1] 的用户满意度评分系统组成),引入偏好批量 GRPO (PB-GRPO),这是一种后训练算法,可以从对话级反馈中学习社交自适应策略。与普通 GRPO 相比,PB-GRPO 使用对具有相似偏好的一组用户进行标准化估计来计算优势,从而在不同的社会人群中稳定训练。经验证据表明,在我们的模拟环境中,PB-GRPO 比强强化学习基线改善了模型的社交行为。

PB-GRPO:通过偏好分批 GRPO 学习社会适应型 LLM 智能体的原论文方法或结果图
图 1:角色驱动模拟和 PB-GRPO 训练概述。对话级别的奖励在偏好角色桶中标准化,以实现策略优化。