论文

ASTRA-QA:文档抽象问答的基准

ASTRA-QA: A Benchmark for Abstract Question Answering over Documents

模型评测基准与评测资源

摘要

基于文档的问答 (QA) 越来越多地包含抽象问题,这些问题需要将长文档或多个文档中的分散信息合成为连贯的答案。然而,现有的基准和评估方法仍然很少支持这种设置,这些基准和评估方法通常缺乏稳定的抽象参考或依赖于粗略的相似性度量和不稳定的头对头比较。为了缓解这个问题,我们引入了 ASTRA-QA,这是针对文档的 AbSTRact 问答的基准。 ASTRA-QA 包含 869 个学术论文和新闻文档的 QA 实例,涵盖五种抽象问题类型和三个受控检索范围。每个实例都配备了明确的评估注释,包括答案主题集、策划的不受支持的主题和对齐的证据。基于这些注释,ASTRA-QA 可以通过直接对主题覆盖范围进行评分并策划不支持的内容来评估答案是否涵盖所需的关键点并避免不支持的内容,从而实现可扩展的评估,而无需进行详尽的面对面比较。跨越普通、基于图形和分层检索设置的代表性检索增强生成 (RAG) 方法的实验表明,ASTRA-QA 为覆盖范围、幻觉和检索范围的稳健性提供了基于参考的诊断。我们的数据集和代码可在 https://xinyangsally.github.io/astra-benchmark 获取。