论文
LLM的参差性解锁科学创造力
LLM Jaggedness Unlocks Scientific Creativity
摘要
随着人工智能的进步,模型并非在均匀改进。相反,进展以参差不齐的方式展开,能力在任务、领域与模型规模之间的增长并不均衡。本工作通过科学想法生成的视角考察这种动态的参差性。我们提出SciAidanBench,一个由开放式科学问题构成的基准,旨在测量大语言模型(LLM)的科学创造力。给定一个科学问题,模型被要求生成尽可能多独特且连贯的想法,有效回答总数作为创造潜力的代理指标。在评估来自8个提供商的19个基础模型(含推理版本共30个变体)后,我们发现参差性既体现在模型之间也体现在模型内部。首先,在通用创造力与科学创造力的跨任务比较中,通用创造力的提升并不一致地转化为科学创造力,揭示了各模型不同的能力画像。其次,在提示层面,更强的模型并非均匀改进;它们表现出高变异性,在某些问题上创造力迸发,在另一些问题上表现有限。第三,在领域层面,单个模型在科学子领域间的强弱不均,反映出碎片化的内部能力画像。最后,我们证明这种参差性是可以被利用的。我们探索推理时计算、知识汇聚与头脑风暴等机制来有效组合模型,并构建了优于任何单一模型的元模型集成。我们的结果将参差性定位为一种资源而非局限:它是AI进程的结构性特征,一旦被理解并加以利用,便能放大LLM驱动的科学创造力。
