论文

面向检索增强生成的神经符号检索器

Neurosymbolic Retrievers for Retrieval-augmented Generation

上下文与知识检索增强

摘要

检索增强生成(RAG)在克服大语言模型的关键局限方面取得显著进展,例如幻觉、缺乏上下文接地以及透明度问题。然而,传统 RAG 系统由三个相互连接的神经组件构成——检索器、重排器与生成器——其内部推理过程仍然不透明。这种透明度的缺失使可解释性变得复杂,阻碍调试工作并侵蚀信任,尤其是在清晰决策至关重要的高风险领域。为应对这些挑战,我们提出神经符号 RAG(Neurosymbolic RAG)的概念,将使用知识图谱的符号推理与神经检索技术相结合。这一新框架旨在回答两个主要问题:(a) 检索器能否为文档选择提供清晰且可解释的依据?(b) 符号知识能否提升检索过程的清晰度?我们提出三种方法来改进这种结合。第一种是 MAR(知识调制对齐检索),它利用调制网络以可解释的符号特征精炼查询嵌入,从而使文档匹配更加显式。其次是 KG-Path RAG,它通过遍历知识图谱增强查询,以提升整体检索质量与可解释性。最后是流程知识注入 RAG(Process Knowledge-infused RAG),它利用领域特定工具、依据经过验证的工作流对检索内容重排。来自心理健康风险评估任务的初步结果表明,这种神经符号方法同时提升了透明度与整体性能。

面向检索增强生成的神经符号检索器 配图
图 1:KG-Path RAG 训练与推理流水线概览。上:跨三个步骤的基于图的排序损失训练过程。初始时,知识图谱包含不确定的关系(步骤 1)。在训练过程中,系统学习识别被满足的边(绿色)并过滤噪声连接(红色叉),逐步构建穿过实体(e_1、e_2、e_3、e_4)的可靠推理路径,以满足查询约束(q_e)(步骤 2–3)。下:推理流水线,展示查询从单个用户问题被扩充为 K 个查询(包含原始问题),随后进行由 BFS(广度优先搜索)引导的多跳图遍历,在一跳与二跳邻居之间区分强连接与弱连接。FAISS(Facebook AI Semantic Search)检索候选文档,排序函数 q(x) 将正例与负例区分开。优化后的检索结果将相关查询与 top-k 文档相结合,通过模板(用户提出的查询/问题、检索到的段落、LLM 生成的答案)加以结构化,并送入 T5 模型生成最终答案。这种对图谱遍历与检索的联合优化,在保持语义接地的同时实现了显式的基于路径的溯源。用户与 T5 之间的双向箭头表示禁用 RAG 的情形,类似于 MentalLLAMA——一个回答心理健康问题的微调模型。