论文

浏览大规模文档集合:用于多文档分析 QA 的 MuDABench

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

模型评测基准与评测资源

摘要

本文介绍了对大型半结构化文档集合进行分析问答的任务。我们推出 MuDABench,这是多文档分析 QA 的基准,其中的问题需要提取和综合大量文档中的信息来执行定量分析。现有的多文档 QA 基准通常只需要来自少数文档的信息且跨文档推理有限,而 MuDABench 则需要广泛的文档间分析和聚合。 MuDABench 利用文档级元数据和带注释的财务数据库通过远程监督构建,包含超过 80,000 个页面和 332 个分析 QA 实例。我们还提出了一种评估协议,用于测量最终答案的准确性,并使用中间事实覆盖率作为推理过程的辅助诊断信号。实验表明,将所有文档视为平面检索池的标准 RAG 系统性能不佳。为了解决这些限制,我们提出了一个多代理工作流程来编排规划、提取和代码生成模块。虽然这种方法极大地改善了过程和结果指标,但与人类专家的表现相比仍然存在显着差距。我们的分析确定了两个主要瓶颈:单文档信息提取的准确性和当前系统中特定领域知识不足。 MuDABench 可在 https://github.com/Zhanli-Li/MuDABench 获取。