用于企业文档搜索的混合检索增强生成,具有知识图扩展、RRF 融合和每块证据对齐评估
Hybrid Retrieval-Augmented Generation with Knowledge Graph Expansion, RRF Fusion, and Per-Chunk Grounded Evaluation for Enterprise Document Search
摘要
从大型企业文档存储库中获取准确、有根据的答案是一个难题。对于混合技术术语、供应商特定首字母缩略词或需要跨多个不相邻部分进行推理的查询,单独使用密集向量检索通常表现不佳。 DocuSearch 的构建正是为了解决这一差距 - 在生产电信网络运营环境中开发和评估的离线、多代理文档智能系统。 DocuSearch 并不依赖于单一检索信号,而是汇集了三个互补的证据来源:使用 BGE-Large 嵌入对 Qdrant 向量存储进行语义搜索、对 SQLite FTS5 索引进行 BM25 全文搜索以及从结构化边缘表进行知识图邻居扩展。这三个排名列表通过倒数排名融合进行合并,向量搜索的信号权重为 0.50,BM25 的信号权重为 0.35,知识图的信号权重为 0.15,使用平滑常数 60 来稳定分数。然后,交叉编码器对融合列表进行重新排序,并使用平衡因子 0.65 的最大边际相关性来修剪结果的相关性和多样性。 DocuSearch 的独特之处在于每个块的评估循环,将每个块视为自己的小型检索问题:LLM 决定该块是否需要更多上下文,它是否完全回答查询,以及答案是否基于检索到的文本。没有根据的答案不予回复;系统会退回到多块合并。在电信语料库上,DocuSearch 的 Precision@10 达到 0.69,Recall@10 达到 0.79,回答证据支持率达到 89.6%,比仅密集 RAG 基线提高了 15、16 和 18.4 个百分点。索引术语:检索增强生成、知识图、倒数排名融合、企业文档搜索、代理评估、BM25、跨编码器重排名、本地部署、LangGraph、电信人工智能。