论文

ZenGen:LLM 的社交思维

ZenGen: Social Mind for LLMs

模型评测基准与评测资源

摘要

随着 大语言模型 从孤立的任务解决转向在人类环境中长期服务,它们需要社交智能:推断心理状态、跟踪社会关系、推理规范以及根据上下文调整行为的能力。本报告介绍了 ZenGen,一个用于测量、内化和奠定社会智能的综合框架。为了进行测量,我们引入了 SoMBench,这是一个基于心理学的基准,涵盖 3 个主要维度、17 个次要维度和 71 个任务范式。它控制 284 个共享场景和 3,481 个专家验证实例的问题格式、叙述视角和上下文长度。对 20 个有代表性的 LLM 的评估揭示了巨大的空间:最好的模型仅达到 72.08% 的整体精度,并且 17 个次级维度没有一个达到 90% 的接近上限带。为了内化,我们开发了 ZenGen,这是一种诊断驱动的训练方法,结合了监督 微调、同策略 蒸馏 和基于规则的强化学习。在五个社交认知基准测试中,ZenGen 始终优于其基本模型,其中 ZenGen-27B-Stage2 取得了最佳平均得分,而 ZenGen-32B-Stage2 仍然与 DeepSeek-V4-Pro 具有竞争力。为了部署时的基础,我们构建了 Actio,一种由Harness控制的推理架构,它将四种类型的支持路由到推理中:用于程序指导的 PRISM、用于运行时心理状态表示的 Starling、用于可重用体验的 SAGE 以及用于外部社会和规范知识的门控 RAG。在五个基本模型和三个基准测试中,完整的工具改进了 15 个模型基准对中的 14 个,并且在 8 个模型基准对中达到最佳或并列最佳,这证明了类型化运行时支持的有效性。总之,这些结果表明,社交智能 LLM 需要在评估、参数内化和部署时基础方面协调进步。