论文
ExeCRE:用于自校正代码生成的执行一致性引导的可靠性估计
ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation
摘要
大语言模型 (LLM) 在代码生成方面取得了显着进展,但它们仍然在需要复杂算法或复杂实现的挑战性任务上苦苦挣扎。最近的方法越来越多地使用代码执行作为反馈,特别是在从生成的代码构造验证信号的自校正管道中。然而,这些管道通常依赖于可靠性未知的监督信号,这可能会引入误导性反馈、不必要的修改和不正确的最终答案。为了解决这个问题,我们提出了 ExeCRE,一个执行一致性引导的代码可靠性估计框架。 ExeCRE 不是通过测试或 LLM 反馈来判断候选代码,而是通过统计分析大量随机生成的输入的执行输出的一致性模式来估计代码可靠性。它通过生成的输入收集执行输出,将它们投射到一致性信号中,并应用 Dawid-Skene 模型来推断潜在代码的可靠性。我们将 ExeCRE 集成到代码生成的自我校正中。实验表明,ExeCRE 持续提高有效性和稳定性,同时大幅减少误导性校正信号。在 LiveCodeBench 上的 GPT-5.2 下,已经正确的代码的误导性反馈案例的平均数量从具有代表性自我更正基线的 113.2 下降到使用 ExeCRE 的 14.0。作为一项额外的研究,我们将相同的可靠性估计策略应用于基于代码的数学推理,并观察到类似的好处。这些结果表明 ExeCRE 可以在基于执行的管道中更可靠地使用生成的代码。