论文

从孤立的任务到结构化功能:大语言模型 的多层分类法

From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models

模型评测评测方法与指标

摘要

大语言模型 (LLM) 评估涵盖不同的任务和基准,但证据仍然围绕任务而不是它们探究的功能进行组织。这种碎片化限制了交叉研究比较,模糊了能力任务的招募,并使覆盖范围的差距难以识别。我们引入了跨原始层、构造层和集成层的 14 个功能域和 91 个子技能的多层分类法。人类认知科学指导能力定义和组织,而不是 LLM 架构。层分配利用了发展优先级和假设的功能支持,而人类起源的构造则适应可观察的模型行为。为了证明操作实用性,我们筛选了 2023 年至 2025 年间来自 ACL、AAAI、ICML 和 NeurIPS 的 31,505 篇论文,并通过多模型注释、共识和仲裁映射了 15,934 篇以 LLM 为中心的论文。直接研究注意力集中在语言语义能力(3,551;22.3%)、推理(3,388;21.3%)、规划和决策(2,149;13.5%)和感知(1,954;12.3%),而六个领域出现在不到 2% 的论文中。在领域内,最常见的子技能的中位流行率为 97.9%,并且出现在 14 个领域中 10 个领域的至少 90% 的论文中。语言语义能力和推理形成了数量最高的对(n = 1,864;11.7%;提升度 = 2.47),而心理理论和社会推理与互动在至少有 20 个同时出现的对中显示出最高的提升度(n = 62;提升度 = 30.84)。通过将分析单元从孤立的任务转变为结构化的能力,分类法支持研究组织、覆盖范围审计、评估解释以及诊断、训练和转移的可测试假设。