论文
超越正确与错误:评估大型语言模型中的二阶社会推理
Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models
摘要
之前的人工智能调整工作主要集中在一阶社会规范上——教授什么是社会可以接受或不可以接受的模型(例如,“不要偷窃”)。然而,社会智力不仅取决于规范认知,还取决于预测谁将执行它以及如何执行(例如,公开羞辱甚至监禁)。这些二阶期望(称为元规范)控制着人们在社会规则被打破时的反应。我们引入了一种新的框架,用于从情绪评估和行为反应两个维度评估大型语言模型(LLM)中的元规范推理,并提出新的分类任务,即预测违规者的自我调节和观察者的其他调节。我们发布了一个多视角数据集 NormReact,包含 450 个违反规范的场景,并针对规范违反者的性别和观察者的社交亲密程度进行了手工注释的情绪和行为反应。目前的大语言模型描绘了一个更加严酷的社会世界:在六种模型中,他们高估了人类期望不采取行动的负面制裁,并且随着社交距离的增加,与人类判断的一致性恶化。这些发现表明,从冲突调解到政策模拟等规范敏感领域的人工智能系统,可能会产生扭曲的社会监管图景:过度体现惩罚,而低估现实世界中实际规范执行的容忍、克制和关系校准。
