论文
代码不仅仅是文本:代码生成的不确定性估计
Code Is More Than Text: Uncertainty Estimation for Code Generation
摘要
大语言模型 (LLM) 越来越多地被部署为代码生成器,其中默默错误的程序会带来真正的安全性和可靠性风险。可靠的不确定性估计 (UE) 对于选择性预测、人机交互审核和下游代理决策至关重要。然而,大多数现有的代码 UE 方法继承自自然语言 (NL) 生成,并忽略了使代码与众不同的属性。我们认为代码在三个方面与 NL 不同:单个错误的词元可能会破坏整个程序(词元脆弱性);算法意图和具体实现可以独立地不一致(意图-代码差距);并且程序可以被执行(可执行性)。我们将这些属性实例化为三个正交的不确定性轴:词汇(Top-K 标记熵)、算法(伪代码一致性)和功能(行为一致性)。在五个代码 LLM 中,我们的三轴集成将平均 AUROC 从最强 NL 派生基线的 0.696 提高到 0.776(+8.1 点)。值得注意的是,在 Qwen3-14B 上,我们的单遍 Top-K 词元熵与最强的多遍基线相匹配,同时价格便宜 3 倍以上;在所有型号中,它仍然是具有竞争力的低成本信号。这些结果表明,代码 UE 值得进行代码特定设计,而不是直接 NL 端口。