论文

基于 LLM 的预测模型解释代码变更风险的初步研究

A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models

摘要

机器学习 (ML) 和人工智能 (AI) 模型的预测通常会受到怀疑,除非它们与可理解的解释相结合。在即时缺陷预测的背景下,突出显示软件变更(差异)的小部分(超出基于规则的 lints)尚未得到广泛研究,其中风险可能集中。在这项工作中,我们利用基于 LLM 的差异风险评分 (DRS) 模型的注意力权重来突出显示模型在预测风险时关注的差异部分。我们将 词元级 注意力聚合为可解释的代码单元(行、块和文件),并在代码审查期间向开发人员提供前 K 个单元作为轻量级的指导形式。我们使用专家标记的导致真正中断的更改来评估我们的方法。结果显示,在突出显示前 2 个大块时,突出显示的片段在 53.85% 的时间内覆盖了专家标记的导致中断的更改行,同时要求开发人员平均审查 26.28% 的更改行。由于注意力是在标准模型推理过程中产生的,因此该方法对于大型开发工作流程是可扩展的,并且可以以较低的额外延迟出现在代码审查 UI 中。