论文

重新思考用于生成代码审查评论的训练数据

Rethinking Training Data for Generating Code Review Comments

模型训练合成数据

摘要

生成代码审查注释已成为自动代码审查的一个重要研究方向,通常被表述为基于差异注释对的文本生成任务。尽管基于学习的方法取得了进步,但生成的评审意见通常是通用的、基础薄弱的或不可操作的。最近的研究还表明,评论评论数据集包含嘈杂或不合适的训练实例,激发了基于 LLM 的数据集清理方法。在本文中,我们认为有问题的训练实例不是同质的,并且一些限制源于任务制定本身的更深层次问题。通过对广泛使用的评论评论数据集进行实证检查,我们识别出不一致的训练对:代码更改和评论评论之间的关系不能提供可靠的学习信号来从本地输入生成可操作的评论反馈的情况。我们得出了一种错位分类法,捕获了三个反复出现的来源:语义模糊、缺乏可操作性和上下文依赖。我们进一步探讨将此分类法合并到基于 LLM 的过滤中是否可以改善有问题的训练实例的识别,观察到检测未对齐的训练对仍然具有挑战性。基于这些观察,我们认为,改善评论评论的生成需要的不仅仅是数据集清理,还需要激发明确的有效性标准、更丰富的上下文输入以及与评论意图和可操作性相一致的评估实践。