论文

Meta 上的自动化低风险代码审查:RADAR、风险校准和审查效率

Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency

摘要

人工智能辅助编码工具改变了软件生产。在 Meta,每个人工着陆 diff 的重要代码行数同比增长了 105.9%,每个开发人员的 diff 数量增长了 51%,其中代理 AI 贡献了超过 80% 的增长。与此同时,及时审查的差异比例有所下降,暴露出代码供应和审查者带宽之间不断扩大的差距。我们提出三个问题,从可行性到校准再到影响:(1)风险分层自动化能否在不同的组织中大规模运行,(2)调整风险阈值如何影响自动化产量和安全性之间的权衡,以及(3)自动审查在多大程度上减少了人工智能生成的变更的端到端延迟?我们部署了 RADAR(风险意识差异自动审查),这是一个多阶段漏斗,可按作者身份和来源类型对每个差异进行分类,在进行合格变更之前应用资格门、静态启发式、机器学习的差异风险评分、基于 LLM 的自动代码审查以及确定性验证。我们通过遥测评估 RADAR,涵盖 535K+ RADAR 审查的差异、政策变化的前后观察比较以及效率结果的双重差异分析。 RADAR 已审查了 535K+ 差异并得出了 331K+ 差异。将差异风险评分阈值从第 25 个百分点放宽到第 50 个百分点,使批准率提高到 60.31%。经过 RADAR 审核的差异的恢复率是非 RADAR 差异的 1/3,生产事故率是非 RADAR 差异的 1/50。 RADAR 将关闭时间中值缩短了 330% 以上,将差异审核时间中值缩短了 35%。具有风险意识的分层自动化可以显着减少人工智能驱动的代码增长造成的审查瓶颈,而不会影响生产安全。