论文
DocScope:对可验证的推理进行基准测试,以实现可信的长文档理解
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
摘要
评估 Multimodal 大语言模型 是否可以在冗长、视觉丰富的文档中产生可信、可验证的推理,需要进行超出端到端答案准确性的评估。我们引入了 DocScope,这是一个将长文档 QA 制定为结构化推理轨迹预测问题的基准:给定完整的 PDF 文档和问题,模型输出证据页面、支持证据区域、相关事实陈述和最终答案。我们设计了一个四阶段评估协议——页面本地化、区域定位、事实提取和答案验证——通过阶段间解耦独立审核轨迹的每个级别,所有评委都通过人类对齐研究选择和校准。 DocScope 包含源自 273 个文档的 1,124 个问题,所有分层证据注释均由人工注释者完成。我们对 6 个专有模型、12 个开放权重模型和几个特定领域的系统进行了基准测试。我们的实验表明,答案准确性无法替代轨迹级评估:即使在正确答案中,完整证据链的最高观察率也仅为 29%。在所有模型中,区域定位仍然是最弱的轨迹阶段。此外,主要的困难源于聚合分散在远距离和多个文档集群中的证据,而预言机研究将忠实感知和事实提取确定为主要的能力瓶颈。跨架构比较进一步表明,激活的参数计数比总规模更重要。基准测试和代码将在 https://github.com/MiliLab/DocScope 公开发布。