论文
TIPCODER:强化学习增强代码生成测试时指令提议者
TIPCODER: Reinforcement Learning Boosted Test-time Instruction Proposer for Code Generation
摘要
代码生成的测试时间扩展通常通过从固定指令采样多个程序来探索解决方案空间。我们研究一个互补的方向:实例级指令空间探索。我们的观察是,许多编码失败源于缺少约束、忽视边缘情况或由原始提示引起的误导性推理路径。为了解决这个问题,我们提出了 TipCoder,一种测试时指令提议器,可以在代码合成之前生成针对特定问题的辅助提示。 TipCoder 将多轮调试轨迹提炼为主动指导,并使用边际效用奖励通过强化学习进一步优化提议者。在推理时,它会生成基本解决方案和提示引导解决方案,并应用奖励模型进行事后选择。这种探索选择设计允许提示暴露额外的候选者潜力,同时减少不必要的指导带来的回归。在评估的代码生成基准和目标代码 LLM 中,TipCoder 提供了一致的指令级测试时间扩展策略,与基于共享奖励模型的选择协议下的随机采样和通用提示优化基准相比具有优势。