论文
多运行框架强化学习:编码Agent的奖励归因与能力迁移
What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
摘要
智能体强化学习(RL)越来越多地在完整执行环境(harness)中运行,多环境方案包含两个选择:将策略暴露于多个环境,并在一组相对优势环境中比较其奖励。本研究在仓库级编码任务中分离出第二个选择。从一个Qwen3-8B监督预热起点出发,对Aider、OpenHands、Qwen Code和SWE-agent的相同任务-环境记录进行回放,使用相同更新次数,在两种分组相对策略优化(GRPO)规则下运行:组内(每个任务-环境配对一个组)和组间(同一任务下环境池化),并用密封的SWE-bench验证oracle在四个源环境和一个未参与训练的最小环境上评分。评估环境是主导变量:在24,000次密封评估中,其解题率均值从2.14%提升至9.27%,提升4.3倍,而训练方案仅提升1.16%。分组规则无显著差异。在被排除的环境上,组间减组内为+0.25个百分点(95%置信区间[-0.48, +1.02]),每项任务八次尝试,组间平均+0.16([-0.41, +0.72]),三个训练种子的个体估计值符号变化;各规则自身种子范围(0.42至0.45个百分点)超过两者差异。两种规则在相同源环境上获得最大收益。优势池化能识别生成环境:基于交叉优势的折叠分类器比随机标签基准高出+4.48个百分点,而组内优势无此表现,且两种规则在每个环境内的最终得分和动作分布完全一致。重新收集一半的在线训练数据未改变这一结果。跨环境信用能实现配置适应,但并不比单环境信用更具备可移植性。多环境强化学习报告应明确分组边界,并在未见过的环境中进行测试。
