论文

用于特定领域数据资产发现的结构化知识基础设施

A Structured Knowledge Infrastructure for Domain-Specific Data Asset Discovery

摘要

企业数据分析代理面临两个结构性故障:通用 RAG 检索到错误的资产 (Hit@10=19.1%),并且没有提供使用知识来防止指标误解——源于四个根本原因 (C1--C4),从语义差距和实体模糊性到模式漂移和资产使用差距。我们提出了一个部署在小红书商业广告数据仓库(5,300+ Hive 表,14 个域)中的两层解决方案。三层双用途知识库(179 个文档,八部分注释模板)同时服务于检索和生成,并通过闭环刷新管道保持日级新鲜度(一次是/否批准,30 秒热重载)。图引导 检索器 (GGR) 使用 2,859 个节点的知识图作为候选门,并通过意图路由实现 71.6 倍的词元减少。场景感知排序器(SAR)应用19类实体识别和显式场景标注;仅负面知识就贡献了 25 个百分点的 Hit@10 增益。在两个 100 个问题的基准测试中,Hit@10 从 19.1% 上升到 96.6% (+77.5pp),知识覆盖率从 56% 上升到 77%,端到端延迟为 4.84--5.33 秒。