论文

了解代码审查机器人自动评估在实践中的局限性

Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

模型评测评测方法与指标

摘要

自动代码审查 (ACR) 机器人越来越多地用于工业软件开发中,以在拉取请求 (PR) 审查期间为开发人员提供帮助。随着采用率的增长,一个关键的挑战是如何可靠且大规模地评估机器人生成的评论的有用性。在实践中,此类评估通常依赖于由上下文和组织因素形成的开发人员操作和注释,这使得它们作为目标 真值 的使用变得复杂。我们研究了在工业环境中自动评估 LLM 驱动的 ACR 机器人的可行性和局限性。我们分析了 Beko 的工业数据集,其中包含 2,604 条机器人生成的 PR 评论,每条评论都被软件工程师标记为“fixed/wontFix”。两种自动评估方法(G-Eval 和 LLM-as-a-Judge 管道)均使用二元决策和 0-4 Likert 量表公式进行应用,从而能够与开发人员提供的标签进行受控比较。在 Gemini-2.5-pro、GPT-4.1-mini 和 GPT-5.2 中,两种评估策略仅与人类标签实现了中等程度的对齐。一致性比率范围约为 0.44 至 0.62,模型之间以及二元和李克特量表公式之间存在显着差异,表明对模型选择和评估设计的敏感性。我们的研究结果强调了在工业环境中完全自动化评估 ACR 机器人评论的实际局限性。解决或忽略评论等开发人员操作不仅反映了评论质量,还反映了难以通过静态工件捕获的上下文约束、优先级决策和工作流程动态。对软件工程总监的后续采访进一步证实,开发人员的标签行为受到工作流程压力和组织约束的强烈影响,从而加大了将此类信号视为客观 真值 的挑战。