论文
基于神经心理学的 LLM 认知能力评估
A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities
摘要
大语言模型(LLM)在 10 个基准上表现出统一的能力“一般因子”,我们对 156 个模型的因子分析证实了这一点,但它们仍在人类看来简单琐碎的任务上挣扎。这是因为当前基准聚焦任务完成,未能探查那些能凸显此类行为的基础认知能力。为此我们提出 NeuroCognition 基准,其基于三个改编的神经心理学测验:瑞文渐进矩阵(抽象关系推理)、空间工作记忆(保持与系统搜索)和威斯康星卡片分类测验(认知灵活性)。评估显示,模型在文本上表现强劲,但图像输入和复杂度提升时性能下降。此外,我们观察到复杂推理并非普遍有益,而简单的人类式策略能带来部分收益。我们还发现 NeuroCognition 与标准通用能力基准正相关,同时测量其之外的独特认知能力。总体上,NeuroCognition 强调了当前 LLM 何处与人类式智能一致、何处缺乏核心适应认知,并显示出作为可验证、可扩展改进来源的潜力。
