技术实践

阿里用分层知识库比较文档检索方案

上下文与知识上下文工程检索增强知识库知识图谱

概述

把团队 831 篇源文档(覆盖 14 个代码服务、5 个业务域)组织成 19 篇金字塔文档:按稳定性与抽象度分为 L1 原则、L2 架构、L3 规范、L4 实现、L5 经验五层,文档作为节点以 governs、defines、constrains、implements、validates、feedback、cross_ref 七类有向边关联,支持上溯、下探、反馈环与场景阅读路径。 按角色-层级访问矩阵为不同角色配置 context_budget 与 priority_order,检索先定位层级再做分层关键词打分并用图谱扩展补充上下游,全部在本地完成、0 次 API 调用,未来计划引入 layer-registry 速查索引。同步上按审计→摄入→后审计三阶段增量更新,用 checksum + entry ID 双重校验做 skip/update/move/write 去重。 评测用 200 条 QA(LLM 生成后人工审核,标注 ground truth 文档 ID)与 RAGAS 指标对比 6 种模式:D Pyramid+RAG 的 Hit@3 89.0%、Hit@5 89.5%,高于 A Naive RAG 的 75.0%/75.0%。MRR 53.7% 对 61.6%,Hit@1 32.5% 对 55.0%。 分维度 Hit@3 上 Pyramid+RAG 在代码细节 98.8%、运维排障 82.5%、架构概念 86.7%、导航 93.3%。