论文
使用 大语言模型 对人类代码审查注释进行自动分类
Automated Classification of Human Code Review Comments with Large Language Models
摘要
背景:代码审查对于维护软件质量至关重要,但许多人工审查意见存在冗余、模糊或缺乏建设性等问题。这些类型的评论可能会减慢反馈速度并掩盖重要的见解。之前关于代码审查评论的工作主要探索有用评论的检测和分类,而评论问题的细粒度分类仍然没有得到充分探索。目标:这项工作旨在设计和评估一个自动化系统,用于根据特定问题类别对代码审查评论进行分类。方法:我们引入了代码审查评论的九标签分类法,涵盖六种审查评论味道和三种常见的有用意图,并手动标记了来自公开数据集的 448 条评论。我们对每个评论及其相关的统一差异块进行了零样本和单样本单标签分类的基准测试,比较了 GPT-5-mini、LLaMA-3.3 和 DeepSeek-R1。我们将宏 F1 报告为主要指标。结果:在类别不平衡的情况下,零样本性能中等(宏观 F1 0.360 至 0.374)。一次性样本调节具有模型依赖性效果:GPT-5-mini 和 DeepSeek-R1 宏观 F1 分数有所提高,但 LLaMA-3.3 略有下降。范例最一致地帮助意图边界标签,而证据敏感标签的分类仍然具有挑战性。结论:我们的结果表明,评论差异证据对于某些标签来说是足够的,但对于证据敏感的气味来说却有限。未来的工作包括添加线程上下文、改进意图保留重写以及验证跨平台的稳健性。