论文

SFBench:SciFy科学可行性基准

SFBench: The SciFy Scientific Feasibility Benchmark

模型评测基准与评测资源

摘要

我们提出SFBench:评估评估科学论断可行性系统的基准数据集。含197条材料科学论断,每条标注有五分制的真值可行性分数及评估解释。与既往数据集的重要区别:1) 定义了一个复杂任务——需要对不同科学可行性的论断做推理;2) 论断并非从既有科学出版物提取而是从头创建——大幅降低LLM已训练于其上的可能;3) 论断与真值由主题专家而非AI建立;4) 不像许多基准要求问答对或选择题,SFBench的解释完全开放式。我们描述基准设计、数据创建过程与评估指标,并报告使用近期GPT模型的基线结果。

SFBench:SciFy科学可行性基准:论文配图
图 1:在 SFBench 上评估的基线模型的二次加权 kappa。误差线显示三轮运行的最大值和最小值。所有模型的推理工作量都设置为高。性能随着新型号基础的提高而提高。 kappa 为零或更低表明没有达成一致。