论文

等长度证据构造检验LLM回答前的信息充分性

Before Answering: Evidence Sufficiency under Size-Matched Memory Construction

模型评测评测方法与指标

摘要

从压缩或检索的内存中回答问题的Agent必须识别出查询所需的证据何时不再位于内存中。此任务的基准通常通过删除支持段落来创建证据不足的示例。我们证明这种结构通过内存大小泄漏了标签:在 MuSiQue 上,仅计算段落的分类器在检测不安全内存时达到了 0.979 美元的 ROC 曲线下面积 (AUROC),高于我们最初评估的词汇估计器。我们提出了一种大小匹配的结构,可以证明消除了这个快捷方式,并用它来研究 MemSafe,这是一种估计器,可以对每个内存单元的查询进行交叉编码,并使用一组转换器聚合这些单元。在三个多跳问答数据集和五个种子中,MemSafe 在 MuSiQue 和 HotpotQA 上达到了 0.968 美元和 0.983 美元 AUROC,高于词汇基线 0.26 美元到 0.39 美元,而第三个数据集 2WikiMultiHopQA 已经饱和。带有逻辑头的冻结预训练交叉编码器已经缩小了词汇基线和 MemSafe 之间 $41\%$ 的 MuSiQue 差距。与此同时,MemSafe 在 MuSiQue 发布的无法回答的问题上降低了较弱的基线,在 SQuAD~2.0 上仅达到 0.639 美元 AUROC,并且需要数千个临床训练示例才能超越基于特征的估计器。用作 7B 读者的门,它在 $5\%$ 覆盖率下将回答问题的错误率从 $0.850$ 降低到 $0.631$,优于读者信心和平均真实完整性标签,尽管 7B LLM 评审在 $10\%$ 覆盖率下是更好的门。这些结果表明,证据不足的构建方式与检测它的估计器一样重要。