技术实践
GitHub用ReviewBench筛选Copilot评审改动,再通过线上A/B确认质量与成本
概述
GitHub团队用ReviewBench比较Copilot代码评审各版本、识别退化并选择候选改动,最终仍用生产A/B测试验证。一个lite-tier实验把多个独立模型运行合并为评审,离线评测预示精确率、召回与评论量提升、单次成本下降,线上方向一致:相对生产对照,addressed rate提高8.0%,召回提高13.6%,评论量提高61%,单次评审成本下降8.0%。addressed rate由LLM根据代码diff、线程、反馈与后续修改判断评论是否促成代码改动,不能直接当人工标注精确率。严重问题评论离线预估增加227%,线上增加262%,亦为该实验的相对变化。实践重点是先离线筛选,再以真实生产影响作最后依据;单个实验与厂商陈述不证明所有后续改动都能得到相同幅度。