论文
大规模因素分析表明机器智能只能部分解释
Large-scale factor analysis shows machine intelligence is only partially interpretable
摘要
语言模型开发中的一个常见假设是,认知能力是围绕通用的、与领域无关的智力因素组织的,就像人类的流体智力一样。这种假设很少被直接检验,之前的尝试也只是在小得多的规模上进行。我们对语言模型中的智力采用潜在变量方法,类似于心理测量学家研究心理结构的方式。每个特定问题集的性能都受到特定领域和与领域无关的潜在因素的影响。我们使用因子分析作为降维技术,分析了 13,251 个已发布的评估分数,涵盖 456 个不同的纯文本基准中的 1,618 个语言模型。由于数据集的超稀疏性质,我们对不同的数据致密器和插补方法进行三角分析。不同偏差模式之间的稳健模式是:1. 根据我们最慷慨的估计,一般智力因素占模型性能方差的 70.8%,远低于我们大多数解决方案中的方差;2. 内容相似的基准不一定聚集在一起;3. $g$ 因素不受任何共同主题支配,并且缺乏证据表明它可以通过标准“智力”基准很好地代理。我们的研究结果与当前将通用智能定义、识别和定位为语言模型开发中的有形结构的努力背道而驰。这使得针对单一概念能力的策略得不到支持,因为它必须达到的一阶能力通常是部分特殊的,并且在实践中无法识别。