产品与服务
GitHub推出ReviewBench研究预览,开放代码评审评测与自助提交
ReviewBench: An open benchmark for AI code review
概述
GitHub发布ReviewBench研究预览评测服务。它从真实GitHub PR分布构造219个PR,覆盖187个公开许可仓库与19种语言,公开问题标签、严重度与类别、评分规则、Judge配置和自助runner。Grounded指标对照固定金标准,Augmented指标进一步判断未在金标准中的真实新问题;跨系统主比较使用grounded recall,避免各自新发现扩大分母带来的混淆。独立高级工程师重新标注与基准判断有96.6%一致率,这是标注核对而非Agent准确率。用户用GitHub登录、登记容器配置与自己的模型key,先在25个PR测试,再对219个PR运行三轮;成绩保持私有,管理员审核后才可上榜。本条按公开评测服务收录,不因“open benchmark”就称其全部实现开源;底层方法与数据可复核,代码许可另需确认。