论文
SciDocBench:面向科学文档理解的流程中心基准与数据管道
SciDocBench: A Workflow-Centered Benchmark and Data Pipeline for Scientific Document Understanding
摘要
科学论文需要模型对文本、方程、图形、表格、代码和数据集进行联合推理,同时保留支持证据的出处。现有的基准通常单独评估这些功能,不清楚多模态模型是否可以支持现实的科学阅读工作流程。我们推出 SciDocBench,这是一个以工作流程为中心的科学文档理解基准。它包含 124 个专家撰写和经过难度筛选的问题,分为 7 个研究助理能力组和 5 个科学领域的 19 个子任务。每个问题在四个匹配条件下实例化,将英文或中文问题与全图像优先或交错文档表示相结合,产生 496 个评估实例以进行受控分析。最强的评估系统仅达到 62.6/100,在文档感知、证据基础、验证和跨文档推理方面存在明显弱点。为了将这些诊断转化为可扩展的训练信号,我们引入了 SciDocIR,这是一种类型化的证据图表示,可以保留科学文档对象、布局和交叉引用关系以及来源。在 SciDocIR 的基础上,我们构建了 SciDocDataset,其中包含约 15K 个监督微调样本和 8K 个强化学习样本,涵盖 14 个可验证的子任务。 SciDocBench、SciDocIR 和 SciDocDataset 共同构成了一个评估训练框架,用于诊断和改进科学文档助手。项目页面可通过此 https URL 获取。
