论文

多运行框架强化学习:编码Agent的奖励归因与能力迁移

What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

模型评测模型训练强化学习模型行为与机制分析RLVRAgentic RL

摘要

智能体强化学习(RL)越来越多地在完整执行环境(harness)中运行,多环境方案包含两个选择:将策略暴露于多个环境,并在一组相对优势环境中比较其奖励。本研究在仓库级编码任务中分离出第二个选择。从一个Qwen3-8B监督预热起点出发,对Aider、OpenHands、Qwen Code和SWE-agent的相同任务-环境记录进行回放,使用相同更新次数,在两种分组相对策略优化(GRPO)规则下运行:组内(每个任务-环境配对一个组)和组间(同一任务下环境池化),并用密封的SWE-bench验证oracle在四个源环境和一个未参与训练的最小环境上评分。评估环境是主导变量:在24,000次密封评估中,其解题率均值从2.14%提升至9.27%,提升4.3倍,而训练方案仅提升1.16%。分组规则无显著差异。在被排除的环境上,组间减组内为+0.25个百分点(95%置信区间[-0.48, +1.02]),每项任务八次尝试,组间平均+0.16([-0.41, +0.72]),三个训练种子的个体估计值符号变化;各规则自身种子范围(0.42至0.45个百分点)超过两者差异。两种规则在相同源环境上获得最大收益。优势池化能识别生成环境:基于交叉优势的折叠分类器比随机标签基准高出+4.48个百分点,而组内优势无此表现,且两种规则在每个环境内的最终得分和动作分布完全一致。重新收集一半的在线训练数据未改变这一结果。跨环境信用能实现配置适应,但并不比单环境信用更具备可移植性。多环境强化学习报告应明确分组边界,并在未见过的环境中进行测试。

多智能体强化学习学习了什么?编码智能体中的信用分配与可移植性:论文配图
图 1:受控多Harness训练和Harness交换评估。四个生产Harness从同一个 SWE-Gym 任务池收集轨迹和奖励;冻结清单保存了主要分支上固定的记录、Token和奖励。在构建 GRPO 组时,交叉池跨Harness的相同任务跟踪,而内部则在每个任务Harness对内单独分配信用。检查点由源Harness和看不见的最小Harness上的相同密封预言机分级。源配置文件的更改将便携性改进与配置适应相结合;保留的更改隔离了在Harness交换中幸存下来的组件。