论文
检索增强生成的潜在抽象
Latent Abstraction for Retrieval-Augmented Generation
摘要
检索增强生成(RAG)已成为利用外部知识增强 大语言模型(LLM)、减轻幻觉和提高真实性的标准方法。然而,现有系统依赖于在每一跳生成自然语言查询,并在 检索器 和生成器之间保持严格的架构分离,从而阻止它们利用 LLM 的完整表示能力。我们提出 \textbf{LAnR} (RAG 的潜在抽象),这是一个统一的框架,其中单个 LLM 完全在其自己的潜在空间内联合执行编码、检索和生成。 LANR 不是生成文本查询,而是从指定 \texttt{[PRED]} 标记的隐藏状态生成密集检索向量,并使用它们与来自同一模型的编码文档表示进行匹配。此外,LANR 自适应地决定何时使用轻量级 MLP 控制头在这些相同的隐藏状态上检索到足够的证据,从而消除了单独的 检索器 和显式 词元级 停止推理。这种设计的动机是我们的经验观察,即答案词元熵可靠地表示检索充分性。对跨越单跳和多跳设置的六个 QA 基准进行的广泛实验表明,LAnR 优于现有的 RAG 方法,同时通过减少检索调用数量和更紧密的模型集成来提高推理效率。