AGC-Bench:测量人工一般创造力
AGC-Bench: Measuring Artificial General Creativity
摘要
创造力研究一直在争论创造力是否是特定领域的(例如视觉、写作、科学),以及它是否在心理测量上与一般智力分离。这两个问题现在都适用于 LLM,但人工智能创造力的统一基准仍然难以捉摸。我们推出了 AGC-Bench,这是一种基于对 AI 创造力文献的系统回顾(筛选了 3,101 篇论文,确定了 497 个基准)而构建的人工通用创造力基准,并搭配了将特殊代码库转换为 HELM 标准化基准的代理工具。第一个版本涵盖 78 个数据集,涵盖头脑风暴、问题解决、STEM、叙事、比喻语言和幽默。为了解决 LLM 作为法官的偏见,我们应用法官反应理论——对法官宽大/严厉的心理测量校准;然后,我们根据三个前沿 LLM 的偏差校正评级对 Qwen3-30B 进行微调,以生成 AGC-Judge,这是一种开放权重模型,可以对未经训练的新创造力基准进行稳健评分。结果显示,前沿模型位居 AGC-Bench 排行榜榜首,开放模型紧随其后。 LLM 显示出不同的创造力优势,在某些领域(例如写作)比其他领域(例如科学构思)排名更高。广泛的实验产生了三个主要发现。首先,对 83 个 LLM 应用因子分析,我们恢复了单个创造力因子“c”,类似于一般智力的“g”因子,它解释了 81.5% 的方差,与一般知识/推理相关但又分开。其次,我们表明,促使模型“发挥创造力”对性能的提升远远大于推理能力,这证明基准测试跟踪的是创造力而不是一般能力。第三,在人类匹配的子集上,我们发现人类在创造力方面仍然领先于 LLM。我们发布了带有公共排行榜、AGC-Judge 和人类数据的 AGC-Bench,作为大规模衡量人工智能创造力的开放基础设施。