论文

LLM的参差性解锁科学创造力

LLM Jaggedness Unlocks Scientific Creativity

模型评测基准与评测资源

摘要

随着人工智能的进步,模型并非在均匀改进。相反,进展以参差不齐的方式展开,能力在任务、领域与模型规模之间的增长并不均衡。本工作通过科学想法生成的视角考察这种动态的参差性。我们提出SciAidanBench,一个由开放式科学问题构成的基准,旨在测量大语言模型(LLM)的科学创造力。给定一个科学问题,模型被要求生成尽可能多独特且连贯的想法,有效回答总数作为创造潜力的代理指标。在评估来自8个提供商的19个基础模型(含推理版本共30个变体)后,我们发现参差性既体现在模型之间也体现在模型内部。首先,在通用创造力与科学创造力的跨任务比较中,通用创造力的提升并不一致地转化为科学创造力,揭示了各模型不同的能力画像。其次,在提示层面,更强的模型并非均匀改进;它们表现出高变异性,在某些问题上创造力迸发,在另一些问题上表现有限。第三,在领域层面,单个模型在科学子领域间的强弱不均,反映出碎片化的内部能力画像。最后,我们证明这种参差性是可以被利用的。我们探索推理时计算、知识汇聚与头脑风暴等机制来有效组合模型,并构建了优于任何单一模型的元模型集成。我们的结果将参差性定位为一种资源而非局限:它是AI进程的结构性特征,一旦被理解并加以利用,便能放大LLM驱动的科学创造力。

LLM的参差性解锁科学创造力:论文配图
图 1:关于一般创造力(AidanBench,x 轴)与科学创造力(SciAidanBench,y 轴)的每个问题的平均回答。红色虚线显示通过原点 (y=0.48​xy=0.48x) 的最小二乘拟合(仅在单个模型上计算,不包括 Top-5 整体配置)。圆圈表示非推理模型,正方形表示推理模型,星号表示本工作中定义的元模型集成配置。模型使用简称显示;全名见图 2。模型远离趋势线的传播是锯齿状现象的一种表现。