论文
路由对齐验证代码生成中的功能正确性
Route-Align-Verify for Functional Correctness in Code Generation
摘要
大语言模型 (LLM) 显着改进了代码生成,但实现强大的功能正确性仍然很困难,特别是对于异构编程任务,其中单个提示策略和单个直接生成的输出通常是不够的。在本文中,我们提出了 RAV,一个轻量级模块化框架,它通过三个协调阶段改进了固定主干模型的代码生成: 路由,在生成之前应用任务感知提示路由;对齐,通过对齐LoRA适配来减少微调提示和推理时间提示之间的不匹配;验证,通过针对可见的公共测试执行多个候选者来选择最终输出。我们在已清理和完整设置下的 MBPP 基准上评估 RAV。完整的 RAV 管道在所有评估的配置中实现了最佳性能,在 MBPP Sanitized 上达到 0.8911,在 MBPP Full 上达到 0.8520。与基础模型相比,这些结果分别提高了 6.35 和 9.92 个百分点。逐组件消融实验进一步表明,当与基于执行的验证相结合时,任务感知路由和对齐适应变得更加有效。额外的稳健性和污染分析支持了观察到的改进的可靠性。总体而言,结果表明,通过联合优化任务的提示方式、模型的适应方式以及最终输出的选择方式,可以在不修改主干架构的情况下显着提高代码生成的功能正确性。