技术实践

阿里内部AI代码评审以确定性工程加Agent协同服务2万月活

概述

该团队在阿里内部做AI代码评审已近两年,服务约2万名月活用户。背景是AI编码工具让代码活动激增、人工评审跟不上,外部遥测报告显示任务完成度提升的同时重写率与生产事故比率大幅上升,代码是AI写的、看不过来不敢合成为普遍痛点。团队的架构选择是「确定性工程×Agent协同」:代码审查中不能出错的环节由工程逻辑而非语言模型保证,模型集中负责动态决策与上下文动态召回;配套200个真实PR标注的评测集做回归验证,内部与外部版本同源同步发布,只提供框架不碰用户数据。文中自述的运行指标包括:AI建议采纳率30%以上、误报率不到5%、合并到基线的有效建议中近八成由AI产出,Token消耗约为Claude Code加Skills方案的九分之一。这些数字为团队自述口径,未见第三方核验;其经验要点在于大规模内部落地依赖生产验证数据、混合架构与明确的容错边界,而非单纯更换更强的模型。