论文

基于神经心理学的 LLM 认知能力评估

A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

模型评测基准与评测资源

摘要

大语言模型(LLM)在 10 个基准上表现出统一的能力“一般因子”,我们对 156 个模型的因子分析证实了这一点,但它们仍在人类看来简单琐碎的任务上挣扎。这是因为当前基准聚焦任务完成,未能探查那些能凸显此类行为的基础认知能力。为此我们提出 NeuroCognition 基准,其基于三个改编的神经心理学测验:瑞文渐进矩阵(抽象关系推理)、空间工作记忆(保持与系统搜索)和威斯康星卡片分类测验(认知灵活性)。评估显示,模型在文本上表现强劲,但图像输入和复杂度提升时性能下降。此外,我们观察到复杂推理并非普遍有益,而简单的人类式策略能带来部分收益。我们还发现 NeuroCognition 与标准通用能力基准正相关,同时测量其之外的独特认知能力。总体上,NeuroCognition 强调了当前 LLM 何处与人类式智能一致、何处缺乏核心适应认知,并显示出作为可验证、可扩展改进来源的潜力。

基于神经心理学的 LLM 认知能力评估
图2:我们的NeuroCognition基准测试与相应真实世界LLM基准之间的相关性。文字加粗且边框高亮的单元格表示相似且依赖相同认知能力的任务对(包括平均值)。统计显著性以星号表示( ∗ p < .05 *p<.05 , ∗ ∗ p < .01 **p<.01 )。