论文

SAVOIR:基于Shapley奖励归因学习社交处世能力

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

模型训练强化学习Agentic RL

摘要

社交智能,即在复杂人际互动中从容周旋的能力,对语言智能体而言是一项根本性挑战。用强化学习训练此类智能体需要解决贡献归因问题:确定单句话语如何促成多轮对话的结果。现有方法直接用语言模型来分配整段级别的奖励,得到的归因是回顾性的且缺乏理论依据。我们提出SAVOIR(ShApley Value fOr SocIal RL),一个以合作博弈论为基础的新型原则性框架。我们的方法结合两条互补原则:期望效用将评估从回顾式归因转向前瞻式估值,捕捉一句话语在促成有利未来轨迹上的策略潜力;Shapley值则以效率、对称性与边际性的公理化保证确保贡献归因的公平。在SOTOPIA基准上的实验表明,SAVOIR在所有评测设定下均取得新的最优成绩,我们的7B模型媲美乃至超越GPT-4o和Claude-3.5-Sonnet等专有模型。值得注意的是,即便是大型推理模型也持续表现不佳,这说明社交智能所需的能力与分析性推理存在质的差异。