论文
弱反馈智能体代码修复中GRPO的信号重塑
Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair
摘要
代码代理强化学习经常收到微弱的反馈:推出时信号是可靠且可执行的,但仅捕获任务成功的必要或表面条件,而不是目标语义谓词。使用agentic编译修复作为设置,我们研究了在这种反馈下标准GRPO的信号重塑。我们的核心主张是,GRPO 的组内比较只有在三种信号被重塑后才有意义:结果奖励恢复语义排名、过程信号本地化轨迹内信用以及来自同一提示的推出保持执行可比性。我们通过最小的信号重塑结构来操作这些条件,使 GRPO 的群体标准化优势结构保持不变:编译和语义分层奖励重塑轨迹排名,群体奖励标准化之外的步骤级过程分数重塑轨迹内更新强度,以及失败原因感知的推出治理重塑群体内可比性。实验显示出明显的端到端增益:完全信号重塑的 GRPO 将严格的编译和语义准确性从基本模型的零样本 0.385 美元提高到 0.535 美元。受控比较进一步解释了这种增益的来源:二进制奖励删除了仅编译的中间层并降低了轨迹控制;除了分层奖励之外,过程分数加权进一步将准确性从 0.48 美元提高到 0.53 美元,并将平均评估步骤从 23.50 美元减少到 17.02 美元。作为边界比较,特权提示令牌级蒸馏主要优化局部分布对齐;在较长的工具使用轨迹中,该信号被非关键标记稀释,并且不能取代结果语义、过程信用或组内可比性。