论文

LitTraceQA:科学问答中多阶段证据对齐和验证的基准

LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

模型评测基准与评测资源

摘要

科学文献越来越多地用作语言模型、检索增强生成系统和研究助理的知识源,但回答论文中的研究问题需要的不仅仅是流畅的生成。可靠的系统必须识别相关论文,找到支持答案的具体证据,并产生忠实于该证据的响应。我们推出了 LitTraceQA,这是针对科学论文进行基于文献的问答的基准。给定一个研究问题和一个论文元数据池,系统必须返回三个相互关联的输出:规范论文标识符、支持证据位置以及一种或多种请求格式的答案,包括自由格式文本、多项选择答案和结构化表格。 LitTraceQA 针对科学阅读中常见的证据类型:表格、图形、文本范围、方程或算法以及引文上下文。公共开发部分包含 55 个示例,其中包括 26 个隐藏来源的单纸问题和 29 个多纸问题,并提供金纸、证据注释和本地验证的答案。我们还分析了更大的最终注释集,其中包含 4,859 篇独特金论文中的 4,978 条独特问题记录。通过分别评估论文检索、证据基础和答案准确性,LitTraceQA 为科学 QA 系统提供了一个测试平台,可生成可验证的答案而不是无支持的摘要。