论文

微调 大语言模型 对拉取请求-问题对齐进行分类:超越提示

Fine-Tuning Large Language Models to Classify Pull Request-Issue Alignments: Going Beyond Prompting

模型评测模型能力评测

摘要

背景:拉取请求 (PR) 与相应问题之间的准确对齐对于高效软件开发和维护代码质量至关重要,因为不一致会降低可追溯性、阻碍缺陷定位并降低可维护性。目的:本研究旨在通过跨多个对齐类别利用微调 大语言模型 (LLM) 来改进自动 PR 问题对齐分类,并进行可解释性分析以研究 PR 问题字段对微调 LLM 预测的影响。方法:我们的方法包括数据集准备、LLM 微调 和可解释性分析。我们首先扩展了现有的数据集并应用数据增强来解决类别不平衡问题。然后通过指令调整对 GPT-4o 进行微调,并使用特定于分类的头对开源 LLM(包括 CodeLlama-7B、CodeQwen1.5-7B、StableCode-3B、CodeGemma-7B 和 Deepseek-Coder-6.7B)进行微调。使用 Shapley Additive Explanations (SHAP) 进行可解释性分析,以检查 PR 问题字段对性能最佳开源 LLM 预测的影响。结果:经过微调的 LLM 优于基线模型,准确率和 F1-micro 平均提高 6.15%,F1-macro 平均提高 14.69%,召回率平均提高 6.15%。 CodeLlama-7B 总体上成为性能最佳的微调 LLM,而可解释性分析表明,代码差异以及问题正文和 PR 正文内容对预测的影响最大。结论:微调 极大地增强了 PR 问题对齐分类,提高了准确性和效率。可解释性分析提供了对驱动对齐决策的数据集功能的可行见解,加深了对 LLM 如何推理软件工件的理解。