论文
功能熵:通过不确定性量化预测 LLM 生成的代码中的功能正确性
Functional Entropy: Predicting Functional Correctness in LLM-Generated Code with Uncertainty Quantification
摘要
大语言模型 在代码生成方面表现出了令人印象深刻的能力,但它们经常生成功能上不正确的代码。不确定性量化(UQ)方法已成为检测自然语言生成中的幻觉的一种有前景的方法,但其在代码生成任务中的有效性仍未得到充分探索。我们系统地评估了 UQ 技术如何跨三种编程语言、五种 LLM 和 1,700 多个问题转移到代码生成。我们发现,一些基于标记概率的方法无需修改即可有效泛化,而依赖自然语言推理(NLI)的基于采样的方法则失败,因为 NLI 模型无法区分功能上不同的代码,导致大多数响应崩溃为单个语义簇。为了解决这个问题,我们引入了 \emph{功能等价方法},这是一系列特定于代码的方法,用基于 LLM 的功能等价评估替换基于 NLI 的语义等价,包括功能熵(语义熵的特定于代码的模拟)。功能等效方法在 15 个模型基准组合中的 11 个中实现了顶级 AUROC,并且在大多数设置中实现了最佳校准,始终优于基于 NLI 的对应方法和所有其他评估的方法。