论文
诊断多跳问答中的事实依据差距
Diagnosing the Fact-Grounding Gap in Multi-Hop Question Answering
摘要
多跳问答需要结合多个文档中的信息来回答复杂的问题。这些系统的功能越来越强大,但当它们失败时,错误通常归因于找不到正确的文档。这是否适用于个人推理步骤的水平仍然很大程度上未经检验。我们通过三个标准的多跳 QA 基准对此进行调查,发现失败分解为两种不同的模式:检索失败,即未检索到所需的段落;提取失败,即检索到了段落,但无法提取所需的事实 - 我们将这种现象称为事实基础差距。提取失败占所有每跳缺陷的近一半,并且对于标准检索指标来说是不可见的。我们测试的每一项检索干预措施都仍未解决这些问题,从而为仅检索的改进设定了上限。差距的严重程度因基准和问题类型而异,但提取失败出现在我们测量的每个数据集上。我们的研究结果表明,检索失败和提取失败是根本不同的瓶颈,需要不同的解决方案——当前的评估实践中缺乏这种区别。