论文

通过分层推理和话语级目标奖励增强 LLM 中的社交智能

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

模型训练强化学习

摘要

大语言模型 (LLM) 擅长结构化任务,但难以应对动态社交互动,在动态社交互动中,成功需要长期目标协调和快速适应。当前的方法通常对每一个话语应用基于目标的统一奖励,忽视了每个对话回合目标的特殊性,并且未能解释潜在策略的基本原理。受计划行为理论的启发,我们提出了思考-策略-响应(TSR)框架,它将社会对话分解为两个层次阶段:高层战略规划和低层语言执行。为了优化 TSR,我们引入了带有方差门控奖励的线性分层强化学习 (LHRL-VGR),这是一种基于目标达成分数的方差动态路由奖励的新颖算法 - 平衡目标完成情况和策略遵守情况。 SOTOPIA 基准测试表明,我们的方法对 Qwen2.5-7B 智能体进行了微调,在目标完成成功率上超出了 GPT-4o 基线 7.32%,展示了多智能体社交谈判任务中最先进的性能。