论文

CogGym:迈向人机认知的大规模比较评估

CogGym: Towards Large-Scale Comparative Evaluation of Human and Machine Cognition

模型评测基准与评测资源

摘要

理解与建模人类智能是人工智能(AI)与认知科学共同追求的目标。随着AI系统能力日益增强,模型响应在哪些方面与人类响应相似,又在哪些方面系统性分歧?人类能够执行和思考的任务广度与多样性,为人类与模型之间可扩展且严谨的比较带来挑战。我们提出CogGym——一个扎根认知科学、可扩展的统一框架,用于在匹配的实验试次上系统比较模型与人类行为。CogGym采用半自动化、人在回路的流水线,将多样的实验范式标准化为任务无关的实验标记语言(EML),支持可复现且忠实的大规模比较。在初始发布中,我们整理并标准化了来自100篇论文、聚焦人类常识推理的258项认知实验,并评估50个大语言模型与人类响应的吻合度。我们发现清晰的规模趋势:更大、更新的AI模型能更好地复现人类判断。然而,AI模型在这类常识推理任务上的改进明显慢于其在数学、编程等形式推理基准上的收益,且模型-人类拟合度仍远低于人类折半信度(文本R²=0.93、图像0.95、视频0.92),最佳模型在文本、图像、视频实验上分别仅达到R²=0.59、0.58、0.43。我们希望CogGym成为持续纳入新认知科学实验的活性评估框架,刻画模型行为在何处与人类相似、在何处系统性分歧,以及这些模式如何随模型与实验的演进而变化。

CogGym:迈向人机认知的大规模比较评估:论文配图
图 1:CogGym 工作流。CogGym 分三个阶段进行。首先,以不同框架实现的原有实验通过带人在环监督的 AI 智能体转换为标准化的实验标记语言(EML)表示。其次,标准化实验被渲染并施测于人类被试和 AI 模型。最后,联合分析人类与模型的响应,以评估实验有效性与模型—人类一致性。