论文
经专家验证的STEM问答
Expert-validated STEM QA
摘要
人工智能的最新进展正在帮助科学家在数学、医学和材料科学等领域取得突破。人工智能模型的新评估数据集有助于人工智能的进步。在 STEM 领域,前沿模型消耗了大部分可用的在线数据,这就产生了对人工创建的数据集的需求,这些数据集将该领域领先专家的知识编纂成文。该领域的研究界有多个 STEM 数据集可用。然而,这些数据集还存在一些差距,还有改进的空间。差距的例子包括(1)这些数据集上的模型性能饱和,没有留下有意义的评估空间,(2)分类分布不平衡,(3)多项选择题格式与科学家在现实世界中使用人工智能的方式不一致,以及(4)不准确的答案和理由,部分由基于竞赛的数据收集和有时限的审查过程导致。在这项研究中,我们提出了“专家验证的 STEM QA”,这是一个高质量、经过专家验证的物理、化学、生物学和数学 STEM 数据集 (N=398),由 241 名领域专家创建。我们(1)精心设计了一个平衡分布的分类法,(2)以质量驱动的激励方式审查问题贡献者,(3)进行了多轮审查,并由领域专家基于共识验证了修订,以及(4)以可验证的问答格式创建了数据集。我们的研究表明,以数据集为基准的前沿人工智能模型的性能较低($<25\%$)。相对于 HLE 验证数据集的 STEM 子集上的基线模型 (p=0.045),在单独的私有版本数据集 (N=2,000) 上进行后训练,开源模型的性能提高了 15%$,这表明该数据集对于模型训练的潜在效用。我们为人工智能研究社区开源了部分数据集。
