论文

从被动智能体代理到策略型谈判者:用SocialRL强化小语言模型的社会推理

From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL

模型训练强化学习Agentic RL

摘要

AI智能体日益代表用户行事,处理安排会议、比较报价和讨价还价等任务。这些由委托人驱动的任务常常让智能体面对一个与其委托人目标可能冲突的对手(另一个用户的智能体、卖家或招聘者)。然而,让助手讨人喜欢的那些性情可能使它成为糟糕的智能体代理:一个友好、乐于助人的前沿模型可能未经提示就泄露委托人的私密信息,并在一遇到阻力时就让步。我们提出SocialRL,一个直接训练社会推理的通用配方,并将其应用于一个4B模型的六个领域:Deal-or-No-Deal、CaSiNo、Craigslist、Job Interview、Calendar和Marketplace。每个领域都在同一配方下进行域内训练,每个策略都在全部六个领域上评估。我们发现:(1)域内训练达到前沿水平:在留出场景上,4B模型在各领域上匹配或超过GPT-5家族,在谈判博弈上弥合了基线到前沿差距的73-122%;未训练时仅3%的买方开局锚定在目标之下,训练后达78%;(2)跨域迁移遵循博弈结构:结构配对的博弈互相促进,宽泛的多议题捐赠域几乎提升所有领域,而结构孤立的博弈不产生迁移;(3)受迁移结构启发,级联RL与多教师在线策略蒸馏(OPD)两种策略将各域专家整合为单一统一4B模型,在六个环境中达到0.627平均效用,匹配或超过GPT-4.1(0.625)、GPT-5.1(0.619)和GPT-5.2(0.613);(4)显式的心智理论(ToM)脚手架只有通过训练才有效:蒸馏ToM轨迹(而非仅蒸馏动作)能提升所有环境上的效用并更好地跨域泛化,而在两种ToM技能中,只有下一动作预测能预测谈判结果。

从被动代理人到策略型谈判者:用SocialRL强化小语言模型的社会推理:论文配图
图1:SocialRL 概览:交互环境、基于事件的智能体接口以及解耦的训练基础设施。(a) 用于委托协调与谈判的社会推理环境示例。(b) 一种基于事件、与智能体无关的接口,其中有状态的环境通过观察、通知和行动的私有通道与智能体通信。(c) 解耦的训练栈,其中 rollout 代理将环境与智能体 harness 连接到推理和训练,实现组件可互换,并同时支持强化学习与蒸馏。