开源项目

code-review-benchmark:AI代码审查评测基准

withmartian/code-review-benchmark

模型评测基准与评测资源

概述

code-review-benchmark 是一个用于评测 AI 代码审查工具的开源基准,面向开发或选型这类工具的团队,把数据集、LLM 评判器与评测管线全部公开。离线部分收集 Sentry、Grafana 等五个开源项目的 PR,并配有人工核对的黄金评论,按严重度与问题类别打标,结果可复现;在线基准持续更新,用于避免训练数据泄露,两者互相校验提升可信度。采用 MIT 许可证,附完整的复现命令,也支持评测自己的工具。做代码审查 Agent 的团队可据此建立统一的对比口径。