论文

基于 LLM 的代码生成的不确定性量化

Uncertainty Quantification for LLM-based Code Generation

模型推理推理验证与自校正

摘要

预测集为量化机器学习模型中的不确定性提供了一个有理论依据的框架。使它们适应结构化生成任务,特别是基于 大语言模型 (LLM) 的代码生成,仍然是一个具有挑战性的问题。现有的尝试提出了 PAC 预测集,但受到其对风险的强单调性假设和单标签分类框架的限制,这严重限制了候选程序的空间,并且无法容纳代码生成固有的多个有效输出。为了解决这些限制,我们提出了一种 RisCoSet 方法,该方法利用多重假设检验来构建基于 LLM 的代码生成的风险控制预测。给定训练有素的代码生成模型,我们生成由部分程序表示的预测集,保证包含高置信度的正确解决方案。对三个 LLM 的大量实验证明了该方法的有效性。例如,与最先进的方法相比,在相同的风险水平下,我们的方法可以显着减少高达 24.5% 的代码删除量。