论文

LitXBench:从科学文献中提取实验的基准

LitXBench: A Benchmark for Extracting Experiments from Scientific Literature

模型评测基准与评测资源

摘要

汇总论文中的实验数据使材料科学家能够建立更好的性能预测模型并促进科学发现。最近,人们不仅对提取单一材料特性而且对提取整个实验测量结果的兴趣日益浓厚。为了支持这一转变,我们引入了 LitXBench,这是一个从文献中提取实验的基准测试方法框架。我们还推出了 LitXAlloy,这是一个密集的基准测试,包含 19 种合金纸的 1426 项总测量值。通过将基准测试的条目存储为 Python 对象,而不是基于文本的格式(例如 CSV 或 JSON),我们提高了可审核性并支持编程数据验证。我们发现前沿语言模型(例如 Gemini 3.1 Pro Preview)的性能比现有的多轮提取管道高出 0.37 F1。我们的结果表明,这种性能差距的出现是因为提取管道将测量与成分相关联,而不是与定义材料的加工步骤相关联。