论文

范围:利用子目标批评进行代码生成

SCOPE: Leveraging Subgoal Critiques for Code Generation

模型训练奖励建模与过程监督

摘要

使用 大语言模型 (LLM) 生成的代码仍然不可靠,因为生成的程序可能看起来正确,但仍然违反自然语言规范中的关键语义要求。现有的基于反馈的方法比仅编码器生成有所改进,但它们通常依赖于非结构化批评或执行信号,这些信号无法明确识别代码在语义上缺失的内容。我们提出了 SCOPE,一个用于代码生成的、由证明者初始化的子目标批评家。 SCOPE 采用面向精益的证明者模型,为下游代码生成生成三个可解析的反馈字段:子目标、差距分析和稳健性检查表。我们的方法结合了监督 微调、流程对齐强化学习 (RL) 和反馈引导推理,以及 RL 期间的两种互补奖励:针对结构化批评质量的密集奖励和基于批评是否提高编码器执行分数的稀疏奖励。实验表明,SCOPE 比反馈基线有所改进。在 LiveCodeBench V6 上,SCOPE 的 pass@1 成绩为 39.4%,而 Reflexion 为 36.6%,纯编码基线为 20.6%。在 BigCodeBench(Hard)上,它达到了 42.6%,超过了 Reflexion 的 36.5% 和仅编码器一代的 34.5%。进一步分析表明,SCOPE 的收益集中在具有具体语义约束的任务上,并且其代码修正比 Reflexion 更本地化。