论文
W-RAG:从异构知识库生成企业文档的源感知检索
W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases
摘要
检索增强生成 (RAG) 使 大语言模型 能够在生成过程中纳入外部知识,从而提高事实基础和领域适应性。然而,现有的 RAG 管道假设可以使用单个相似性函数对从多个存储库检索的证据进行全局排名。虽然适用于开放域检索,但这种假设在企业文档生成中被打破,其中异构知识库(例如政策、法规、技术文档和部门指南)发挥着不同的作用,并且必须在生成的文档中共同表示。因此,全球排名常常会产生由部分来源主导的不平衡上下文,从而导致企业草稿不完整。为了解决这个限制,我们提出了 W-RAG,一种源感知检索框架,它执行本体引导检索、每个知识库内的本地排名以及源级加权来调节证据构成。我们进一步引入了一个新的数据集,用于跨多种文档类型和行业领域的基于检索的企业文档生成。实验表明,标准 RAG 管道难以完成此任务,而 W-RAG 显着提高了文档覆盖率和生成质量。