论文
LatentRAG:高效代理 RAG 的潜在推理和检索
LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG
摘要
单步检索增强生成(RAG)提供了一种有效的方法来整合外部信息来完成简单的问答任务,但难以解决复杂的问题。 Agentic RAG 通过用多步骤过程替换单步检索来扩展此范例,其中 大语言模型 (LLM) 充当搜索代理,生成中间思想和子查询以迭代地与检索系统交互。由于冗长的思想和子查询的自回归生成,这个迭代过程会产生大量的延迟。为了解决这个限制,我们提出了 LatentRAG,这是一种新颖的框架,它将推理和检索从离散的语言空间转移到连续的潜在空间。与逐个生成自然语言思想或子查询的现有显式方法不同,LatentRAG 直接从单个前向传递中的隐藏状态生成思想和子查询的潜在标记。我们将 LLM 与潜在空间中的密集检索模型结合起来,从而实现对潜在子查询标记的检索并支持端到端联合优化。为了提高透明度并鼓励语义上有意义的潜在表示,我们采用了并行潜在解码机制,将潜在标记翻译回自然语言。对七个基准数据集的大量实验表明,LatentRAG 的性能可与显式代理 RAG 方法相媲美,同时将推理延迟减少约 90%,从而大大缩小了与传统单步 RAG 的延迟差距。