论文

越大并不总是越好:LLM 用于自动代码审查的比较评估

Bigger Isn't Always Better: A Comparative Evaluation of LLMs for Automated Code Review

摘要

我们对五个 大语言模型 的自动代码审查进行了系统评估,比较了 Claude Sonnet 4.6、Claude Haiku 4.5、GPT-5.4 mini、Minimax M2.7 和 GLM-5 Turbo 的 150 个代码审查样本 - 100 个合成突变注入错误和从 8 个主要开源存储库挖掘的 50 个真实错误修复拉取请求。我们的主要发现是,Claude Haiku 4.5(一种更小、更便宜的模型)始终优于更大的 Claude Sonnet 4.6,实现了更高的 F1(0.365 与 0.343)、召回率提高了 18%,并且在所有四个评估维度上都获得了出色的定性评论分数,而每次评论的成本降低了 3.2 倍。该结果在三个独立的实验条件(n=25、n=100、n=150)中成立,并在 Martian Code Review Benchmark(具有不同存储库、参考审查意见和判断的第三方评估)上得到独立证实。我们进一步报告了三个次要发现:(1)仅合成评估极大地高估了模型能力 - 仅在实际 PR 上,最佳模型达到 F1 = 0.066,与合成样本上的 F1 = 0.847 相比,下降了 92%; (2) diff 大小是评论质量的主要预测因素,F1 从 10 行以下 diff 的 0.657 下降到 150 行以上 diff 的 0.043; (3) 所有模型对性能相关错误的召回率几乎为零。我们发布了评估框架和数据集以实现可重复性。