论文

选择并提取:用于检索增强生成的轻量级插件

Select-And-Extract: A Lightweight Plugin for Retrieval-Augmented Generation

上下文与知识检索增强

摘要

语言模型(LM)系统的检索增强生成(RAG)从根本上来说有两种失败模式:检索失败和阅读失败。前者无法从外部语料库中回忆起正确的信息,而后者即使检索到了正确的信息也无法产生正确的答案。一些方法针对检索失败执行结构化索引,但可能会受到固定结构的有限泛化的影响。有些方法针对读取失败执行查询时结构化,但通常需要大量 LM 调用,并且严重依赖 LM 的功能。为此,我们提出了 Select-AND-Extract (SANE),这是一个简单而有效的 RAG 插件。对于检索失败,我们检索了具有语义 检索器 的大量候选者,并利用 LM 根据概要选择最佳候选者,这比原始 检索器 产生了更好的召回率。对于读取失败,我们执行蓝图引导的查询时证据提取,这允许生成器LM仅使用紧凑且结构化的关键信息,以便它可以执行更好的推理。实证结果证实 SANE 带来了坚实的改进,同时只引入了适度的额外开销。作为 RAG 的轻量级插件,SANE 为较重的方法提供了一种简单的替代方案,并建议高性能 RAG 框架不必过于复杂。