论文
生成式AI模型各代认知的不均衡演化
Uneven Evolution of Cognition Across Generations of Generative AI Models
摘要
对通用人工智能的追求需要强大的方法来评估模型的认知能力,而不仅仅是狭隘的任务表现。在这里,我们引入了一个心理测量框架来评估生成人工智能的认知概况,将它们与人类规范进行比较并跟踪它们在几代人之间的演变。使用改编自韦克斯勒成人智力量表的任务对领先的多模态模型进行初步评估,揭示了一种极其不平衡的认知结构:言语理解和工作记忆的接近天花板的表现(>$98^{\text{th}}$百分位)与感知推理的近乎地板的表现(<$1^{\text{st}}$百分位数)形成鲜明对比。为了追踪超越人类规范极限的发展轨迹,我们开发了人工智能商数 (AIQ) 基准,并将其应用于六代和两个模型系列,揭示了显着但不对称的性能提升。值得注意的是,我们发现模式之间存在明显的分离;与视觉上类似的格式相比,抽象定量推理在以语言方式呈现时成熟得更快,这表明建筑上倾向于基于语言的符号操作。虽然抽象视觉推理得到了改善,但视觉感知组织在很大程度上仍然停滞不前。总的来说,这些发现表明,生成模型的认知能力发展不均衡,这表明仅靠 AGI 开发的扩展和优化方法可能不足以克服实现平衡的、类人通用智能的基本架构限制。
