论文

DiDPO:面向编码Agent训练的双重差分策略优化

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

模型训练强化学习RLVRAgentic RL

摘要

可验证奖励强化学习(RLVR)已成为训练编码智能体的强大范式,其中来自编译与测试的执行反馈提供客观验证。然而与一般智能体任务不同,编码智能体面临独特且更细粒度的信用分配挑战:在每一步中,编码动作同时把不同的变更打包进代码版本的多个区域,使独立变更的贡献难以区分。现有RLVR方法大多利用结果奖励或步骤级奖励,无法深入代码diff内部,使编码动作的独特性质对训练不可见。本文提出双重差分策略优化(DiDPO),一种无critic的RL方法,直接从代码diff的结构构建细粒度信用单元。DiDPO将多轮编码交互组织为多个“思考-动作”步骤,并在采样轨迹之间发现代码diff。随后,它通过“可分组分数”把每个完整diff切分出的高度相似子diff聚合起来选取锚点,该切分方案在锚点的语义范围与其可能形成的组规模之间取得最优平衡。最终,这些锚点构成优势组,把diff级优势投影回各个响应token。在长程编码与推理基准上的实验表明,DiDPO显著优于强大的agentic RL基线。在Qwen2.5-7B-Coder上,DiDPO超出可比方法10%以上并缩小了与更大模型的差距,为编码Agent训练中的细粒度信用分配提供了一个有原则的框架。我们还开源了verl-code,一个支持多种RL方法与编码基准的agentic RL代码库。

DiDPO:面向编码Agent训练的双重差分策略优化:论文配图
图1:上:对于许多智能体任务,每个智能体动作被视为在一个状态上的单一决策单元。下:对于编码任务,许多编码动作可能作用于状态的不同部分,同时产生多个功能子差异(sub-diff)。