论文

XL-DocBench:基于证据的超长文档理解基准测试

XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding

模型评测基准与评测资源

摘要

现实世界的文档任务通常要求专业人员回答长达数百或数千页的年度报告、法规、临床指南和技术手册中的问题。有些问题还需要对比相关报告。因此,可靠的长文档理解是在合规、临床、财务和工程工作流程中使用 LLM 的先决条件,其中决策必须可追溯到特定的证据页面,并且不受支持的答案的成本很高,但大多数现有基准仍然衡量短上下文或单页 QA。我们推出了 XL-DocBench,这是一个经过完全人工验证的超长文档理解基准,包含来自六个专业领域和上下文的 1,519 个保留问题,长达 2,303 页。 XL-DocBench 超越了页面级查找。 1,103 个示例 (72.6\%) 使用多个证据页。最终集还包括 556 个问题 (36.6%) 使用表格、图表或图形,以及 165 个问题 (10.9%) 需要来自多个文档的证据。每个问题都有 12 个推理标签之一、专家注释的证据页、键入的验证规则和答案格式,包括 218 个无答案案例。我们使用树引导的合成管道构建基准,然后进行工件过滤器并由 194 名人类专家进行全面验证。通过将超长的专业上下文与页面级证据和类型化规则相结合,XL-DocBench 填补了之前的单页、短多页或纯文本长上下文基准测试留下的空白,并让未来的工作将系统故障归因于检索、证据使用或规则遵循,而不是单个排行榜分数。结果表明,当前的系统仍然难以应对长上下文、多页证据和专业文档的结构化推理。