论文

CoCR-RAG:通过面向概念的上下文重建增强网络问答中的检索增强生成

CoCR-RAG: Enhancing Retrieval-Augmented Generation in Web Q&A via Concept-oriented Context Reconstruction

上下文与知识上下文工程

摘要

检索增强生成(RAG)通过整合来自网络和其他外部来源的信息,在增强问答方面显示出了有希望的结果。然而,从异构网络检索到的支持文档通常来自多个来源,具有不同的写作风格、不同的格式和不一致的粒度。将此类多源文档融合到连贯且知识密集的背景中仍然是一个重大挑战,因为不相关和冗余信息的存在可能会损害推断答案的事实一致性。本文提出了面向概念的上下文重建 RAG(CoCR-RAG),这是一个通过语言基础概念级集成解决 RAG 中多源信息融合问题的框架。具体来说,我们引入了一种概念 蒸馏 算法,该算法从抽象含义表示(AMR)中提取基本概念,AMR 是一种稳定的语义表示,将文本的含义构建为逻辑图。然后,大语言模型 将多个检索到的文档中提炼出的概念融合并重构为统一的信息密集型上下文,仅补充必要的句子元素以突出核心知识。 PopQA 和 EntityQuestions 数据集上的实验表明,CoCR-RAG 在这些 Web 问答基准测试中显着优于现有的上下文重建方法。此外,CoCR-RAG 在各种主干 LLM 上表现出稳健性,将其自身打造为一个灵活的、即插即用的组件,可适应不同的 RAG 框架。