技术实践

得物财务数仓用大模型完成OneData标准化建模

应用与实践上下文与知识智能体系统AI 基础设施模型评测上下文工程Agent 工具调用智能体互操作协议数据基础设施评测方法与指标编程MCP

概述

针对财务核算 OneData「口径溯源复杂、规范执行不一致、跨域依赖复杂、文档输出繁琐」四大难点,团队把「规范即 Prompt × 迭代收敛法 × 海量文件阅读」作为建模方法论:先沉淀模型设计规范(表命名、时间周期、生命周期、刷新周期)、标准字段英文命名原则({主体/fin}{业务场景/费用类型}{币种标识}{度量类型}{时间单位})、财务业务全链路设计理念(计费→核算→结算→财务分析)、业务过程总线矩阵与数据质量监控规范作为 Prompt 输入;再让模型读取目標表建表语句输出 ODS→DWD/DIM→DWS→ADM 的重构建模建议,并以「抽取涉及条件取值的复杂字段(分摊、冲销、多口径)对照 SQL 验证溯源路径」的方式迭代核验;同时把历史文档与既有表、代码一次性灌入超大上下文,由模型读出子模块逻辑、辅助绘制业务架构图。第一版核算数据结构已落地,正文披露收益为口径溯源与文档输出等标准化工作大幅压缩、表/字段/时间周期等规范遵守率较人工明显改善、规范文档与工具脚本与 Prompt 模板与流程 SOP 可跨子域复用(已在核算域、技术成本域验证)、并基于口径逻辑自动推荐 DQC 规则。 以财务 UE 表某次迭代为案例,团队把 AI 用于 PRD 阅读与代码开发两段:PRD 侧让模型把目标、指标、维度、过滤条件提炼为结构化要点,并对「大促期间」「小仓卖家」「冲销」等未精确定义表述自动生成待确认清单,输出指标口径、统计周期、主键与粒度等待确认条目;编码侧按五步跑:整理需求成技术文档→模型读 DWD 源码分析字段来源与需新增关联→模型在 DWD→DWS→ADM 三层自动添加字段代码并输出改动集合→引入指标字典与 Cursor Rules 让模型按规范去掉不规范后缀重命名字段→模型生成自测 SQL 逐层验证数据一致性、不通过时追问原因并溯源。同时在性能侧由模型结合执行计划、大表扫描、数据倾斜识别瓶颈,给出分区裁剪、谓词下推、JOIN 顺序、中间结果物化等改写建议,并针对 Spark/ODPS 引擎给出资源配置、并行度、倾斜处理等调参方案。正文披露的收益为指标分段与注释清晰度提升、历史「屎山」代码结构化改写后维护与排查成本下降、从需求到可上线代码耗时缩短、以及经模型辅助做表合并与逻辑下沉后表数量与运行时间双降、基线提前完成。 针对财务指标「正向-冲销=冲销之后」「子项相加=汇总项」等严格勾稽关系与跨周期分摊难以验证的问题,团队在某次财务 UE 表邮费迭代项目(涉及多个邮费字段的计算逻辑修改、大批量细分字段新增、历史字段废弃、邮费返利抵减与冲销逻辑调整)中深度应用 AI:提出测试要求后由模型自动生成覆盖四类验证逻辑的完整测试 SQL 与说明文档(正向-冲销=冲销之后、子项相加等于汇总项、业务规则转化、边界场景);从规则理解层面补充抽样验证、精度验证等人工易漏的用例,在跨周期分摊场景识别被忽略的测试点;对复杂逻辑逐步分析(如退小仓场景下的邮费冲销多分支),寻找潜在代码 Bug;分析字段改动对上下游的影响以识别需同步验证的相关字段;自动生成公式验证 SQL 并区分真正的逻辑错误与可接受的浮点精度误差,避免误报。收益为测试 SQL 生成效率与用例覆盖度提升、一次交付通过率提升、人工难以发现的逻辑错误被识别。 针对「理解 PRD 与业务产品反复核对口径占数仓总体工作时间较大比例」的痛点,团队通过飞书 MCP 让 Cursor 直接读取 BI 需求文档,由大模型自动总结 DWS 层与 ADS 层各自需要改动的内容,并按表分类输出字段含义/口径调整、数据来源与计算点(应收邮费与实收邮费新口径)、新增字段清单(应收拆分、冲销相关、实收拆分、成本、UE 等)、废弃字段清单、冲销逻辑重点(退小仓规则)、以及两表关系与实现顺序(先改 DWS 再改 ADS)。典型 Prompt 为读取「邮费逻辑梳理」文档内容、分析其文字描述与财务 UE 表代码、列出改动点并生成对应改动代码与改动原因注释。收益是团队能快速发现 PRD 缺失内容并快速对齐,总体沟通时间有效缩减。