技术实践
阿里直播数据团队用LLM Wiki组织指标知识
概述
针对知识散落、口径矛盾、文档腐化导致口径答疑与代码生成「知识喂不进去」的问题,团队不直接套 RAG,而是在检索前加一道 LLM 编译:把 DDL、任务代码、接口配置、钉钉文档、看板元数据等源材料编译成 frontmatter + 正文的结构化 Wiki 页面(表、接口、数据集、概念为基础页面,域、看板、指标、维度、index、overview 为聚合页面),冲突以「代码即真相」仲裁,页面保留 sources 证据链,关系显式存为 graph.json(8 类节点、8 类边)并反哺 downstream 字段。 由 wiki-orchestrator 编排 material-prep、base-generator(批间串行、批内 5 路并行)、advanced-generator、graph-builder、health-check、query 等 Skill,Phase 2 做 6 项健康检查。检索走意图识别、域 + 关键词 + 图扩展的多路召回、脚本粗排加 LLM 精排。 落地到三类场景:指标与维度召回、跨域 SQL 生成、数据模型迭代影响分析(需求拆解→知识库召回→血缘查询→风险评级→SQL 生成→报告输出六步,关键节点用户确认)。效果:血缘查询 30min→2min(15×),下游表遗漏率 20%→0%,SQL 生成 0.5 天→10min(72×),模型迭代影响分析从半天缩短到小时级。