论文
基于集成的代码正确性估计的不确定性估计
Ensemble-Based Uncertainty Estimation for Code Correctness Estimation
摘要
大语言模型 (LLM) 在根据自然语言描述生成程序方面表现出了卓越的能力,但在没有外部预言机的情况下确保其正确性仍然是一个严峻的挑战。为了解决这一挑战,现有方法通常依赖于不确定性估计,测量单个模型生成的多个样本之间语义或执行行为的一致性。然而,我们观察到单个模型通常可以收敛到一致但不正确的解决方案,从而使这种基于一致性的代理无效。为了解决这个问题,我们提出了集成语义熵(ESE),它通过评估模型集成中聚合样本的一致性来估计不确定性。 LiveCodeBench 上的实验表明,与单模型语义熵相比,ESE 与程序正确性的相关性更强。值得注意的是,在具有严格假阳性率限制的选择性生成任务中,ESE 将预测精度提高了 53.4%。此外,通过利用 ESE 作为决策信号,我们提出了一种级联测试时间扩展框架 Cas,与单模型扩展相比,它在保持性能的同时将 FLOP 减少了 64.9%,为平衡参数和推理扩展提供了新的视角。