论文
CogArena:大语言模型 中认知能力结构的多方法评估
CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models
摘要
LLM 认知分数越来越多地被概括为每项能力概况,其维度应跨任务收敛,选择性地响应匹配的干预措施,并概括到用于定义它们的模型之外。我们引入了 CogArena,这是一个程序生成的 13 范式基准,围绕多方法框架构建,用于确定认知任务分数何时需要跨五个理论驱动的分组进行维度标签。在 55 个开放权重模型中,几乎所有范式相关性都是正的,并且公共轴解释了大约一半的方差。组内优势很小,对评分敏感,并且在模型系列中具有不确定性。在一项针对 6 个家族的 12 个模型的单独冷冻、完全交叉的研究中,目标支架显示出较小的匹配分组优势,但没有支架特异性对比能够经受多重校正,并且选择性不能改善保留的家族预测。冻结确认标准失败。事后替代措辞复制产生较小的正估计,并再次失败。这些结果共同支持了一个边界结论。与理论一致的提示产生了小的测试组合内部对角线趋势,但目前的证据并未建立稳定的五维轮廓。 CogArena 提供了一个工作流程,在将认知标签附加到模型分数之前,将行为特征、协方差、匹配干预和家庭外预测结合起来。