论文
FrontierScience:评估AI执行专家级科学任务的能力
FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks
摘要
我们提出FrontierScience,一个评估前沿语言模型专家级科学推理的基准。近期的模型进展已使现有科学基准近乎饱和,这些基准往往依赖多选知识题或已发表信息。FrontierScience通过两个互补赛道弥补这一差距:(1)Olympiad赛道,由IPhO、IChO和IBO水平的国际奥赛题组成;(2)Research赛道,由代表科学研究子任务的博士级开放式问题组成。FrontierScience包含数百道题(其中160题在开源金标准集中),覆盖从量子电动力学到合成有机化学的物理、化学和生物学子领域。所有奥赛题均由国际奥赛奖牌得主和国家队教练原创,以确保难度、原创性和事实性标准。所有研究题均为由博士科学家(博士候选人、博士后研究人员或教授)撰写并验证的研究子任务。对于Research赛道,我们引入细粒度的基于量表的评估框架,以评估模型在解决研究任务全过程中的能力,而非仅评判独立的最终答案。
