论文

PageRecall:文献问答中证据页面选择的召回瓶颈

PageRecall: Measuring Page Selection in Literature-Grounded Question Answering

上下文与知识上下文工程

摘要

我们描述了我们的 LitTraceQA 系统(GroundLM @ EMNLP 2026):给定一个研究问题,从 27,487 篇论文中检索相关论文,引用答案所在的页面和表格或图形,并以要求的格式回答。我们的主要发现是,证据基础受到检索的限制,而不是阅读的限制。页面选择器将注释者的页面(我们称之为黄金页面)放在模型前面,该模型仅在大约一半的情况下定位证据(52.6% 的黄金页面召回率),而该模型在给定页面的情况下,在其发出的 48 个定位器中,有 45 个定位器引用了正确的页面(94%)。当页面丢失时,它很少这么说:在 45 种此类情况中,有 14 次没有返回任何内容,有 24 次返回错误页面,有 7 次返回正确页面,因此管道悄然失败的次数几乎是明显失败的次数的两倍。由于失败是从未显示正确的页面,因此解决方法是停止选择:每篇检索到的论文都适合模型的上下文,因此我们将其整体显示。页面排名仅作为论文太长而无法容纳的后备方案而存在,而测试分割论文则不然,而金页召回率在我们可以解析的论文中达到 100%。另外,通过位置而不是内容来识别目标的问题,例如“第 24 篇参考文献的第一作者”,是通过解析而不是检索来提供的:我们将参考书目解析为可寻址列表,该列表还提供了证据度量分数的标识符。最终系统在保留测试拆分中的论文得分为 0.762 分,证据得分为 0.441 分,多项选择准确度为 0.920 分。由于管道依赖于没有种子控制的封闭模型,因此我们发布了一个工具来验证论文的中心声明是否针对已提交的工件。