技术实践

淘天用成熟度模型评估存量工程AI演进

模型评测上下文与知识智能体系统应用与实践上下文工程Agent 动作执行与治理Agent Harness评测方法与指标编程

概述

借鉴 CMMI 五级结构提出 AI Native 能力成熟度模型 AINMM:ML1 已感知→ML5 持续优化,围绕上下文工程、能力封装、验证回路、协作契约、自进化五大过程域(PA1-PA5)与五个评估维度(D1-D5)构建,配 8 阶段 SOP,等级判定取所有关键过程域都达标的最高等级;配套开源命令行工具 AI Native Evolution Kit(audit.sh 自动评估、init-workspace.sh、evolve.sh)支持从评估到生成到持续进化;模型每一级定义均源于所维护两个生产级项目的真实踩坑,并在存量 Java 系统「挽单」上验证迭代。 对千余个 Java 文件、基于内部微服务框架 + RPC + 分布式数据库中间件 + 消息队列 + 配置中心的存量挽单系统做 ML1 改造:把散落在 Code Wiki、钉钉群与口头约定的知识索引化为 150 行 AGENTS.md,按「AI 不知道就会写错」标准建 docs/ 目录实现信息分级,把内部 CI/CD 命令行能力与预发部署规则、发布回滚策略写入上下文,将 182 行经验按「问题→根因→解法」重排为 MEMORY.md 并建立已知陷阱清单;改造前 AINA-C 自动评估总分 30 分、ML1 水平,系统此前已沉淀 6 个 Qoder Skills、2 个 Agent 平台技能。 在 ML2 基础上向 ML3 推进:建立置信度路由机制,高置信(>90%)自动推进、中置信(60-90%)标记审查、低置信(30-60%)暂停等人、极低置信(<30%)拒绝执行;在团队推行「目标收敛→状态恢复→上下文装配→任务分块→链路设计→执行前校准→外部验证→回写」8 阶段统一 SOP,用断言-验证-校准闭环建立人机之间的信任协议,把直播/直播无关的通用规则沉淀进 Rule 层,业务特定规则保留人工决策。文中标注该阶段改造进行中。