论文
自动代码修订中 LLM 置信度校准的细粒度方法
Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision
摘要
在当今的人工智能辅助软件工程领域,开发人员越来越依赖 LLM,它们功能强大,但本质上并不完美。这些模型产生错误输出的倾向会降低开发人员的生产力。为此,规范的缓解方法是提供校准的置信度分数,忠实地反映其在实例级别正确性的可能性。此类信息使用户能够立即做出有关输出接受的决定,避免容易出错的输出,并更好地将他们的期望与模型的功能保持一致。由于训练后的 LLM 本质上不会产生经过良好校准的置信度分数,因此研究人员开发了事后校准方法,序列级置信度分数的全局 Platt 缩放在许多生成软件工程任务中被证明是有效的,但对于程序修复、漏洞修复和代码细化等自动代码修订 (ACR) 任务仍然不可靠或未经探索。我们假设这种传统方法的粗粒度性质使其不适合 ACR 任务,其中正确性通常由本地编辑决策决定,而错误校准可能与样本相关,从而激发了细粒度的置信度校准。为了解决这个问题,我们的研究提出将局部 Platt 缩放分别应用于三个不同的细粒度置信度分数。通过对 3 个独立任务和正确性指标以及 14 个不同规模的模型进行实验,我们发现细粒度的置信度分数在更广泛的概率区间内始终能够实现较低的校准误差,并且当应用全局 Platt 缩放时,这种效果会进一步放大。我们提出的方法提供了一种实用的解决方案,可以得出经过良好校准的置信度分数,从而在 ACR 任务中更可靠、更简化地使用不完美的模型。