论文

通过词元共现图进行高效检索-增强生成

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

上下文与知识检索增强

摘要

检索增强生成 (RAG) 通过将生成过程建立在外部知识的基础上,减轻了 大语言模型 (LLM) 中的幻觉。然而,标准 RAG 方法难以应对多跳推理。虽然最近基于图的 RAG 方法改进了互连块的检索,但它们通常依赖于计算成本昂贵且容易出错的基于 LLM 的提取管道。为了解决这些问题,我们提出了 TIGRAG(Token-Induced GraphRAG),这是一种基于词元共现知识图的高效图增强 RAG 框架。 TIGRAG 使用滑动窗口共现统计直接对词元之间的拓扑关系进行建模,从而实现可扩展的图构建。在推理过程中,它结合了基于图的语义扩展和神经重新排序来检索多跳推理的互连证据。具体来说,它引入了一种迭代实体驱动的检索策略,该策略使用从先前检索的上下文中提取的桥接实体逐步扩展查询。我们根据三个广泛采用的多跳问答 (QA) 基准评估了 TIGRAG。实验结果表明,我们的框架在检索和下游 QA 任务中始终优于密集检索和基于图的 RAG 方法,同时大幅减少索引时间、推理延迟和提示占用空间。