论文

CRJudgeBench:人工智能可以检测看似合理但无效的代码审查吗?

CRJudgeBench: Can AI Detect Plausible but Invalid Code Reviews?

模型评测基准与评测资源

摘要

大语言模型可以生成看似合理的代码审查注释,但此类注释可能包含技术上不正确的声明,从而误导开发人员。我们研究技术可信度判断:确定评审评论的核心技术声明是否正确并适用于其存储库上下文中的已评审代码。现有的代码审查基准主要评估审查生成、问题发现或一般评论质量,但不直接评估Agent是否可以确定单个审查评论的技术可信度。为了填补这一空白,我们引入了 CRJudgeBench,这是一个由 1199 个实例组成的基准,由真实的拉取请求和专家验证的扰动构建,涵盖可信和看似合理但不可信的评论。我们进一步介绍了 Sentinel,一个基于存储库的 Agentic 判断器,它在做出判断之前主动收集代码证据来验证评审意见。从 Qwen3-Coder-30B-A3B-Instruct 开始,Sentinel 通过来自特权教师的迭代动作级学习在 CRJudgeBench 训练中接受训练。在 359 个实例的 CRJudgeBench 测试集上,Sentinel 的准确率达到 76.60%,比 GLM-5.3 提高 6.13 个百分点,比基础模型提高 19.78 个百分点。这些结果表明,即使是最先进的通用大语言模型也很难识别不可信的评论,而迭代行动级学习大大提高了基于存储库的可信度判断的准确性。我们的数据集可在 https://huggingface.co/datasets/dcloud347/CRJudgeBenchmark 获取