论文

Social-R1:迈向LLM中的类人社会推理

Social-R1: Towards Human-like Social Reasoning in LLMs

模型训练强化学习

摘要

尽管大语言模型在众多领域展现出卓越能力,社会智能——即感知社会线索、推断心理状态并生成恰当回应的能力——仍然是一个关键挑战,这对实现有效的人机协作以及开发真正服务于人类需求的AI尤为重要。当前模型常常依赖表面模式,而非真正的社会推理。我们认为,培养类人的社会智能需要用能够抵御捷径解法的挑战性案例进行训练。为此,我们提出ToMBench-Hard,一个旨在为社会推理提供困难训练样本的对抗性基准。在此基础上,我们提出Social-R1,一个通过多维奖励将模型推理与人类认知对齐的强化学习框架。与基于结果的强化学习不同,Social-R1监督整个推理过程,强制要求结构对齐、逻辑完整性与信息密度。结果表明,我们的方法使一个4B参数模型超越了大得多的对手,并在八个多样化基准上稳健泛化。这些发现表明,具有挑战性的训练案例结合轨迹级对齐,为高效且可靠的社会智能提供了一条路径。

Social-R1:迈向LLM中的类人社会推理:论文配图
图 1:用于类人高效社交推理的 Social-R1。通过将 SIP 引导的奖励集成到强化学习中,Social-R1 减少了推理捷径并强制执行结构化的类人社交推理,从而提高了模型规模的准确性和效率。详细案例见附录6。