论文

SolidCoder:通过具体执行弥合 LLM 代码生成中的心理与现实差距

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

摘要

最先进的代码生成框架依赖于心理模拟,其中 LLM 内部跟踪执行以验证正确性。我们暴露了一个基本限制:心理现实差距——模型产生执行轨迹的幻觉并自信地验证有缺陷的代码。这种差距体现在两个正交维度上:规范差距(在规划过程中忽略边缘情况)和验证差距(对有缺陷的代码产生正确的行为幻觉)。我们提出 SolidCoder 的原则很简单:不要想象——执行。 S.O.L.I.D.架构通过在算法设计之前强制边缘情况意识并使用基于属性的预言机用沙盒执行替换想象的痕迹来解决这两个维度。借助 GPT-4o,SolidCoder 实现了最先进的 pass@1 性能:HumanEval 上为 95.7% (+0.6%p),CodeContests 上为 77.0% (+4.3%p),APPS 上为 26.7% (+3.4%p)。消融表明,边缘情况意识提供了最大的个人收益,而执行基础则捕获了规范改进无法解决的明显不同的错误。这些收益可推广到 RL 训练后模型,验证了桥接两个间隙维度对于稳健的代码合成至关重要。我们发布我们的代码和框架以促进未来的研究。