论文

SCRuB:基于量规评估的社会概念推理

SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

模型评测基准与评测资源

摘要

虽然许多关于大语言模型 (LLM) 推理能力的研究都强调数学或技术任务,但很少涉及社会概念的推理:塑造社会规范、文化和制度的抽象思想。这种未被充分研究的能力对于作为社会主体的现代模型至关重要,但没有系统的评估方法针对它。我们引入了 SCRuB(基于 Rubric 的评估下的社会概念推理),这是一个专为这种任务不确定性设置而设计的框架。我们的目标是衡量模型以人类专家的深度和批判严谨性推理社会概念的程度。 SCRuB 分三个阶段进行:根据既定来源进行快速构建、由专家和模型生成响应以及使用五维批判性思维量规进行比较评估。为了实现管道的泛化,我们引入了经过独立专家评委验证的纪律观点小组。我们发布了 SCRuBEval(n=4,711 条评估提示)和 SCRuBAnnotations(300 条专家撰写的回复和来自 45 名博士级学者的 150 条专家比较判断)。我们的结果表明,前沿模型在所有五个标准维度上始终优于人类专家。在 1,170 次配对比较中,专家评委在 80.8% 的判断中将模型响应排在第一位,并且在 74.4% 的时间内首选模型响应。最终,这项研究首次以专家为基础证明了社会概念推理的评估饱和度:单轮考试式的形式对于模型和人类来说都已经达到了上限。

SCRuB:基于量规评估的社会概念推理:论文配图
图 1:用于评估大语言模型中的社会概念推理的 SCRuB 框架。在第一阶段(数据集构建)中,我们将源数据集转换为开放式推理提示(SCRuBEval);这里使用烧烤作为说明性示例(参见§2)。在第二阶段(响应生成)中,人类专家和语言模型都会响应相同的提示,产生一组混合的推理输出。在第 3 阶段(基于评分标准的评估)中,基于评分标准的评估者应用我们的多维批判性思维评分标准对回复进行排名(参见§3)。