技术实践
阿里用Spec、检查点和安全网约束AI编码
概述
作者把「人定方向、模型推进」的 Harness 方法用于真实研发:起手先用反 slop 讨论把模糊需求揉成 spec(0→1 项目写 IDEA_DOC,存量项目读历史 spec 或用 codemap 生成代码地形索引),再切出「小到可检查、大到可自治」的最小混沌单元任务包(目标/边界/自由度/checkpoint/验收)整包交给模型。 推进中在 checkpoint 上用放行、追问、加料、绕道、回炉、阻止六类动作控盘,作者自己几个项目的真实分布为加料约 47%、追问约 25%、放行约 9%、绕道约 5%、回炉约 2%。spec 冲突、越界或连续两次验证失败即强制转向,并用 new-chat 换干净上下文实施。验收走自验、自测、独立 agent review(case B 中另一个 agent 找出 4 处 race condition)、CI 自动化回归与巡检、灰度金丝雀五层 safety net。 效果:最近 20 天 AI 提交 70 万行代码、10 个项目并行。case B(某大型企业客户反馈的敏感资源外发审批卡片每 5 分钟重复推送)以 Tair 两段式幂等(processing lock 60s + active pending 30min,key 为 orgId+uid+ruleId+resourceId+targetHash)加灰度 key 上线,实施仅用一个 session 推完。