论文

使用语义距离估计基于 LLM 的代码生成中的不确定性

Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation

模型评测鲁棒性、公平性与可信度评测

摘要

LLM 在代码生成方面表现出强大的性能,但其输出缺乏正确性保证。基于样本的不确定性估计器通过生成多个候选程序并衡量它们的分歧来解决这个问题。然而,现有的估计者对于如何识别、聚合、引用和比较行为做出了不同的设计选择,这使得它们难以评估。因此,我们首先引入一种分类法来理清这些选择,并揭示一个缺失的设计点:语义距离感知的不确定性估计,它不仅衡量采样程序是否不一致,还衡量它们的执行行为差异的严重程度。在 LiveCodeBench、MBPP、HumanEval-X 和 BigCodeBench 中,涵盖 Python、Java 和 C++,我们的指标为正确性提供了强大的代理,并且在闭源模型(GPT-3.5-Turbo、GPT-4o-mini、Gemini-2.5-Flash-Lite、Claude Opus 4.5)和开源模型中始终优于最先进的基于样本的基线(DeepSeek-Coder-V2)。该方法很实用:它既不需要模型内部结构,也不需要 LLM 作为判断调用,在模型、语言、采样温度和模糊设置方面保持鲁棒性,并且相对于现有基线,运行时间减少了大约 48-79%。