论文

InfiniteScienceGym:无界、程序生成的科学分析基准

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

模型评测基准与评测资源

摘要

大语言模型 正在成为科学助手,但评估他们根据经验数据进行推理的能力仍然具有挑战性。来自已发表研究和人工注释的基准继承了发表偏差、已知知识偏差、标签噪声和大量存储要求。我们推出了 InfiniteScienceGym,这是一个按程序生成的科学存储库基准,并配有可验证的问答任务。从种子开始,模拟器确定性地生成一个具有真实目录结构、文件和表格数据的独立存储库,并且特权 QA 生成器会生成具有精确 真值 的可回答和不可回答的问题。这使得在受控环境中评估基于证据的推理、弃权和工具介导的分析成为可能,而无需分发大型静态语料库。 InfiniteScienceGym 通过针对盲点和故障模式来补充真正的科学基准,而仅使用已发布的数据集很难评估这些盲点和故障模式。在评估专有模型和开放权重模型时,我们发现没有一个模型的总体准确率超过 50%,识别无法回答的问题仍然是一个主要弱点,而且更强大的模型往往会更有效地使用工具,而不是简单地消耗更多词元。