论文

检索增强生成中的归因压缩前沿

The Attribution-Compression Frontier in Retrieval-Augmented Generation

模型评测上下文与知识上下文工程评测方法与指标

摘要

上下文压缩减少了检索增强生成中的生成器输入,但答案质量本身并不能表征引文归因。我们测量压缩方法和预算的引文归因,比较重排序、提取选择、抽象摘要、标记修剪以及在固定生成器和初级蕴涵评估器下对 ASQA 和 QASPER 进行提取-聚类-重写构造。在 ASQA 上,名义预算为 0.25(达到压缩 0.08),RECOMP 式压缩器的引文相对于其摘要的精确度为 0.86,但根据我们的重新归因协议,相对于源跨度的精确度为 0.12。这些估计依赖于跨度恢复和引文评分的共享 NLI 模型,并且缺乏独立的人工校准。提取选择的观察到的原文证据支持精确率范围为 0.43 到 0.49,名义预算为 ASQA 上下文的二分之一到十分之一,而答案质量却下降。对于相同的 RECOMP 设置,源恢复后的声明验证在检查摘要时产生不受支持的比率 0.88 与 0.17。这种差距持续存在,超出了对来源缺失的结构性拒绝,但仍然依赖于评估者。包含 200 个问题的 TRUE T5-XXL 审计还发现了固定和重新计算的源映射下的已输出引用与原文支持之间的差距,而无需建立人工校准的支持率。