论文
CogGym:迈向人机认知的大规模比较评估
CogGym: Towards Large-Scale Comparative Evaluation of Human and Machine Cognition
摘要
理解与建模人类智能是人工智能(AI)与认知科学共同追求的目标。随着AI系统能力日益增强,模型响应在哪些方面与人类响应相似,又在哪些方面系统性分歧?人类能够执行和思考的任务广度与多样性,为人类与模型之间可扩展且严谨的比较带来挑战。我们提出CogGym——一个扎根认知科学、可扩展的统一框架,用于在匹配的实验试次上系统比较模型与人类行为。CogGym采用半自动化、人在回路的流水线,将多样的实验范式标准化为任务无关的实验标记语言(EML),支持可复现且忠实的大规模比较。在初始发布中,我们整理并标准化了来自100篇论文、聚焦人类常识推理的258项认知实验,并评估50个大语言模型与人类响应的吻合度。我们发现清晰的规模趋势:更大、更新的AI模型能更好地复现人类判断。然而,AI模型在这类常识推理任务上的改进明显慢于其在数学、编程等形式推理基准上的收益,且模型-人类拟合度仍远低于人类折半信度(文本R²=0.93、图像0.95、视频0.92),最佳模型在文本、图像、视频实验上分别仅达到R²=0.59、0.58、0.43。我们希望CogGym成为持续纳入新认知科学实验的活性评估框架,刻画模型行为在何处与人类相似、在何处系统性分歧,以及这些模式如何随模型与实验的演进而变化。
