论文
执行反馈比流水线拓扑更重要:1—3B模型代码生成研究
Feedback Over Form: Why Execution Feedback Matters More Than Pipeline Topology in 1-3B Code Generation
摘要
1B至3B参数的小语言模型便于本地运行,但单独处理较难代码生成任务的能力有限。我们研究将模型组合为流水线能否补足能力,比较带执行反馈的流水线,并用受NEAT启发的进化搜索检验复杂结构是否优于简单修订循环。HumanEval的164题与清理后MBPP的427题均在单台笔记本本地推理。执行反馈驱动的自修订在两个基准上改善代码生成表现,幅度均超过四个标准差。改善主要来自修复NameError、SyntaxError等运行错误,较少解决AssertionError等逻辑错误。所测通用模型中,修订模型能力比生成模型身份更重要:1.5B生成器搭配3B修订器可匹配3B模型同时承担两种角色。提前停止至关重要,否则每轮迭代都是净负收益。代码专用模型优于所有通用模型流水线,说明专业化比流水线架构更关键。没有执行反馈的初步纯文本流水线未在此规模下显示收益。在受限搜索空间中,进化搜索主要重新发现人工找到的简单生成—执行—修订循环,增加拓扑复杂度未产生明确显著改善。单次评估的适应度会把结果抬高5%至7%,偏向选中运气好的候选而非真正更好的候选。因此,在所测1B至3B模型与基准下,执行反馈比增加流水线复杂度更能决定模型组合是否有效。