论文

TaPR:反馈条件代码生成中的测试感知策略优化

TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

模型训练强化学习RLVRAgentic RL

摘要

多轮代码代理依赖执行反馈来修复错误的程序,但标准的强化学习范式主要通过单步回报来优化和评估策略性能。这种不匹配将初始代码生成与基于反馈的细化相结合,丢弃了中间轮次的细粒度执行信号,并且无法评估策略是否真的具备自我修复能力。我们提出 Test-aware Policy Refinement (TaPR),这是一个框架,将执行反馈转化为一个统一的多轮交互协议下的每轮测试通过率奖励。在 LiveCodeBench 上的 219 个代码生成问题上,TaPR 在六种模型上将三轮成功的平均率(Pass@3)提高了 2.44 个百分点。在预定义的 7B/8B 高预算范围内,平均准确率从 30.25% 增加到 33.56% (+3.31 个百分点),在配对试验中增加了 42 个改进,减少了 13 个退步。在匹配的 Qwen3-8B 基础上,密集的奖励在所有第一轮中提供非零反馈,并且在测试预算内达到更高的硬集顶点,尽管 GRPO 在第 300 步时与测试后的平均通过率相当。我们的主要贡献是一个奖励分解框架和一个轮次-aware 的评估协议,它们将第一次生成的质量与多轮修复能力解耦。