论文
NICE:一个基于理论的 LLM 社会智能诊断基准
NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs
摘要
随着大语言模型(LLM)日益被应用于情感陪伴、客户服务等社会情境,衡量其社会智能已成为关乎人机交互质量与安全的关键。然而,现有的社会智能基准缺乏一个将社会能力组织为统一结构的统一框架,因而无法实现细粒度诊断。为了构建首个以社会理论为基础的整体性诊断评估,我们首先在心理测量学原则的指导下,通过文献综述与多阶段专家验证构建了一个社会智能框架。所得框架包含 4 个类别与 11 个维度,每个维度进一步由细粒度能力侧面加以刻画。在该框架的基础上,我们提出 NICE(Norm、Interaction、Cognition、Experience),一个包含 137 个条目、通过代表性中文情境实现操作化的诊断基准。在 5 个前沿 LLM 与一个人类参照组上,模型的总准确率更高,却在沟通(Communication)方面表现出一致的弱点,该框架将其定位于 3 个具体能力侧面:多轮沟通、非言语沟通与同步性(synchrony)。由此,NICE 将社会智能评估重新定位为对 LLM 中具有社会影响的弱点的、有理论依据的诊断。
