论文

Theory Trace Card:理论驱动的 LLM 社会认知评测

Theory Trace Card: Theory-Driven Socio-Cognitive Evaluation of LLMs

模型评测评测方法与指标

摘要

面向大型语言模型(LLM)的社会认知基准常常无法预测真实世界行为,即使模型取得很高的基准分数。已有工作将这种评测—部署差距归因于测量与效度问题。这些批评颇具洞见,但我们认为它们忽视了一个更根本的问题:许多社会认知评测在没有对目标能力作出显式理论设定的情况下进行,使连接任务表现与能力之间关系的假设保持隐含。缺乏这一理论根基时,仅覆盖某一能力狭窄子集的基准常被误读为广泛能力的证据:这一差距掩盖了未能评测该能力其他关键维度的事实,从而制造出系统性的效度错觉。为填补这一空白,我们做出两项贡献。第一,我们将这一理论缺口诊断并形式化为一种基础性失败,它破坏测量并导致基准结果被系统性过度推广。第二,我们提出 Theory Trace Card(TTC),一种设计为伴随社会认知评测使用的轻量文档工件,它显式列出评测的理论基础、所覆盖的目标能力成分、操作化方式及其局限。我们认为,TTC 通过显式呈现连接理论、任务操作化、评分与局限的完整效度链条,提升社会认知评测的可解释性与可复用性,同时无需修改基准,也无需就单一理论达成共识。

Theory Trace Card:理论驱动的 LLM 社会认知评测 配图
图 1:基准评估中社会能力的坍缩。共情等理论构念(左)是多维的,由彼此不同且往往正交的成分组成,例如共情关注(Empathic Concern,帮助他人的动机)与个人痛苦(Personal Distress,指向自我的焦虑)。当评估依赖低维基准(右)时,这一复杂的状态空间被坍缩为单一标量指标。其结果是,在性质上截然不同的行为画像——如安全的共情(蓝色)与有害的基于痛苦的镜像(红色)——会得到无法区分的分数,从而制造出一种效度错觉,可能掩盖模型的不安全行为。