论文

用于错误分类的多任务 LLM:利用辅助解码头进行高效推理

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

摘要

LLM 支持的代码生成的快速采用极大地加速了软件开发,但有效的验证方法仍然严重不足。现有的错误定位技术要么过于昂贵,需要几分钟的代理推理和每个文件生成数千个词元,和/或以不适合精确调试的粗略函数级粒度运行。而专注于行级粒度且更轻量级的作品通常在性能或上下文大小方面受到限制。我们引入了一种新颖的行级错误定位方法,该方法通过三个关键贡献解决了这些限制:(1)克服了之前工作中基本标记化挑战的标记对齐算法,(2)用于错误定位(MLC)的轻量级多任务LLM,可实现高效的行级错误分类,以及(3)用于多行预测的优化训练配方。我们的方法在具有完整文件上下文的行级错误定位的类似设置中实现了最先进的性能。同时,我们在 Defects4J 和 PypiBugs 基准上达到了与代理方法相当的性能,同时将推理延迟减少了几个数量级,每个文件只需要一个生成的词元。我们通过在 Python 中引入和评估小型域外评估数据集,进一步证明了强大的泛化能力。我们将在接受后开源我们的代码、模型和数据集。