论文

SciDocBench:面向科学文档理解的流程中心基准与数据管道

SciDocBench: A Workflow-Centered Benchmark and Data Pipeline for Scientific Document Understanding

模型评测基准与评测资源

摘要

科学论文需要模型对文本、方程、图形、表格、代码和数据集进行联合推理,同时保留支持证据的出处。现有的基准通常单独评估这些功能,不清楚多模态模型是否可以支持现实的科学阅读工作流程。我们推出 SciDocBench,这是一个以工作流程为中心的科学文档理解基准。它包含 124 个专家撰写和经过难度筛选的问题,分为 7 个研究助理能力组和 5 个科学领域的 19 个子任务。每个问题在四个匹配条件下实例化,将英文或中文问题与全图像优先或交错文档表示相结合,产生 496 个评估实例以进行受控分析。最强的评估系统仅达到 62.6/100,在文档感知、证据基础、验证和跨文档推理方面存在明显弱点。为了将这些诊断转化为可扩展的训练信号,我们引入了 SciDocIR,这是一种类型化的证据图表示,可以保留科学文档对象、布局和交叉引用关系以及来源。在 SciDocIR 的基础上,我们构建了 SciDocDataset,其中包含约 15K 个监督微调样本和 8K 个强化学习样本,涵盖 14 个可验证的子任务。 SciDocBench、SciDocIR 和 SciDocDataset 共同构成了一个评估训练框架,用于诊断和改进科学文档助手。项目页面可通过此 https URL 获取。

SciDocBench:面向科学文档理解的流程中心基准与数据管道:论文配图
图 1:SciDocBench 概述。 (a)从文本提取到证据基础。可以通过恢复可见内容来回答直接文本提取提示,而 SciDocBench 示例还需要找到支持科学主张的文档证据。 (b) 基准和评估设计。 SciDocBench 包含 124 个专家撰写和经过难度筛选的问题,涉及 5 个科学领域、7 个能力组和 19 个子任务。其双轴协议将双语问题变体与 All Images First 和 Markdown Interleaved 文档表示配对,为每个问题生成四个匹配的设置。使用适合任务的基于规则的、大语言模型作为法官或基于执行的评估器来评估响应。这些图总结了群体主导模型的能力群体和评估设置概况,而示例则说明了匹配的问题和文档表示变体。