技术实践

美团以预审、对抗审查和人工测试治理AI代码

AI 基础设施模型评测应用与实践AI 开发与运维平台评测方法与指标编程

概述

AI 编码效率提升后 Code Review 成为全链路瓶颈,该团队把人工 CR 的价值从「你写得对吗」改为「我们是否在正确的约束下解决正确的问题」,并建立四项机制:一是 Pre-PR(预审)机制,提交代码前要求 RD 先用 AI 审查代码多轮自查,修复规范类、Bug 类、异常处理、一致性、可扩展性及性能等 AI 可发现的问题,通过后再提交由 AI 按代码改动生成的标准 PR 文档(说明改动点、影响范围、需重点 Review 的业务逻辑),使 Reviewer 只聚焦核心业务语义。 二是用高配模型作为 Judge Model 审查低阶模型的编码产出。三是让不同厂商的模型互相审查对方编码产出,实测 CR 覆盖面更全。测试侧该团队 100% 需求由研发兼任测试(RD as QA),在比较两条路线后确认「人工主导、AI 辅助」路线(路线 A 全自动生成用例因缺乏全局业务认知、依赖 PRD 质量、发散大量无价值边缘用例而被放弃),沉淀为 Human-in-the-loop 测试 SOP:Step1 由 AI 从流量监控+代码变更双向扫描自动收集受影响接口清单,人审核确认范围。 Step2 由 AI 读代码回答改了多少、分支在哪、旧数据是否兼容,人据此做风险分级,把评估从小时级压缩到分钟级。Step3 用判定表「先拆后合」自动生成最小 Case 组合,人审核分组并补充业务特殊场景。Step4 按「一步操作、多维验证」模板批量生成可执行测试步骤。Step5 自动生成接口×维度覆盖矩阵并标记未覆盖项,由人最终确认无盲区。