论文

使用本地开放权重语言模型标记错误修复提交

Labelling Bug-Fixing Commits with Local Open-Weight Language Models

模型评测模型能力评测

摘要

缺陷预测取决于知道哪些提交修复了错误,但对其进行编码的标签是由每个引入噪声的路由生成的。重用的基准会带来记录的数据质量问题,问题跟踪器链接存在偏差,底层报告经常会出现错误,并且提交消息中的匹配关键字是一种粗略的启发式方法。本文研究了提交是否可以仅从其内容标记为错误修复,使用本地运行的开放权重语言模型,从而保持流程的可重复性、语料库规模的廉价性、可在专有代码上使用并且独立于任何问题跟踪器。针对跨越 Java、Python 和 JavaScript 的手动验证和策划的错误修复数据集,我们将关键字基线与一组不同大小的开放权重模型进行比较,提示每个模型提交消息和代码差异。在手动验证的语料库上,关键字基线恢复了不到一半的修复,而开放权重模型恢复了绝大多数,并且在统计显着性上优于每个存储库,并且较大的模型并不总是优于较小的模型。我们进一步表明,没有负面例子的评估语料库无法支持此类分类器的精确感知比较。我们将标签管道与由推荐配置生成的带标签的多语言语料库一起发布,作为用于构建当前的、特定于项目的数据集的可复制的银标准资源。