技术实践

得物以血缘和规范生成数仓文档与DDL

应用与实践上下文与知识AI 基础设施上下文工程数据基础设施编程

概述

为解决 OneData 分层与指标口径统一在人工执行下「规范遵守率波动、历史口径梳理耗时」的问题,团队不让模型直接阅读杂乱 SQL,而是用脚本预先提取底层表的血缘关系与字段清单,转化为高度结构化的 CSV(如某域 onedata_表血缘.csv、某域 onedata_字段清单.csv),连同规定字段分隔符与溯源必须到 ODS 层等要求的 Markdown 规范文档一并作为 Prompt 注入。 输出侧要求模型严格按契约产出标准化口径溯源文档(文档格式统一度达到 100%)、Mermaid 架构图(如 引力onedata_表血缘_mermaid.md)以及符合分层规范的 DDL 语句,模型负责解析多层嵌套子查询。实测效能:某业务线 34 张表、6 个粒度的 OneData 重构项目,对比历史同等规模项目纯人工约 60 人日的评估耗时,AI 辅助加人工复核模式整体交付周期缩短至 16 人日(提效约 74%)。