技术实践
得物数仓量化AI编码中的上下文与知识缺口
概述
得物离线数仓各小组已基本完成 AI Coding 工具覆盖,主力工具为 Claude Code,辅以数据平台的 IDE 插件,应对重复性工作时效率提升明显。团队实测暴露三类结构性痛点:痛点一,AI 不记得上下文约束、开发中反复「失忆」——会话开始时告知「金额字段单位是千元」,对话过半后 AI 忘记,生成的 SQL 把千元当元用导致数据差 1000 倍。 正文指出这不是偶发而是 Claude Code 的 context compact(上下文压缩)机制的系统性限制,对话 token 接近上限(约 95%)时历史内容被自动压缩为摘要、token 缩减到原来约 12%,临时口头约束全部丢失。痛点二,规范执行不稳定——OneData 命名规范、注释三段式、INSERT 必须带 PARTITION 子句等,项目工期紧张时人工规范遵守率降至 60%~70%,AI 靠 prompt 记忆的规范遵守率也只有 70%~80%。 痛点三,大型需求开发中 context 迅速被撑满:血缘查询结果 500~3000 tokens、自测 23 条 SQL 执行结果 5000~15000 tokens、SKILL 规范文件内容约 10000 tokens,加上两表样本比对数据,触发 compact 后关键约束遗忘、AI 开始犯低级错误。 正文还给出数仓 AI 开发的语义瓶颈数据:需求理解偏差占总返工的 40%~60%,约 40%~50% 的工作时间花在理解需求和与业务核对口径上。