论文

AbstRAG:学习抽象检索问题

AbstRAG: Learning to Abstract for Retrieval Problems

上下文与知识检索增强

摘要

当查询、文档证据和用户意图以不同的抽象级别表达时,检索增强生成通常会失败。查询可能询问类、关系或事件,而文档仅说明特定实例、间接框架或范围表述。我们将这种不匹配定义为抽象差距:将查询意图与可用证据保持一致所需的最小类型假设集。为了弥补这一差距,我们引入了 AbstRAG,它将抽象视为显式检索对象。 AbstRAG 将查询证据差距分解为表达、概念、意图证据和事件类型组件,并通过结合匹配质量、独立于查询的效用先验以及所需桥梁的成本来对相关性进行评分。其核心机制是反思性细化:批评者诊断检索失败,定位失败的抽象运算符,提出最小的阶段特定补丁,并仅在充分性和压缩控制下接受补丁。在针对 7 个基线的三个文档内检索基准测试中,AbstRAG 在 21 个配对引导对比中的 18 个中优于 nDCG@10,并且在三个基准测试中将生成准确率提高了 1.9%、5.2% 和 4.0%;消融证实反射细化驱动了大部分检索增益,并且仅压缩控制就将应力切片上的过度扩展误报从 73.7% 降低到 0%。