论文
Harness-RL:黑盒强化学习与中央智能体多智能体Harness的动作参数解耦
Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses
摘要
大语言模型 代理越来越多地通过多代理利用来解决长期任务,其中中央代理协调专门的子代理、工具和环境。在这样的框架下训练中央政策提出了两个挑战。首先,动作标签是低基数决策,而其参数形成高维条件序列;使用共享序列级信号优化两者可能会产生冲突的梯度。其次,动态调度创建了具有分支、并行调用和重写上下文的相互依赖的会话,这些会话不能忠实地简化为一个平面词元序列。我们引入了 Harness-RL,这是一种结构化强化学习框架,它将冲突感知策略优化 (CAPO) 与界面级黑盒轨迹构建相结合。黑盒组件捕获接口调用记录,构建每个会话的前缀树,并将结果和过程奖励与可训练词元对齐。 CAPO 使用前向激活来识别与操作和 args 词元关联的参数分区,然后将其策略梯度路由到相应的子空间。 Harness-RL 支持仅中央训练和联合多智能体训练。在七个多跳问答和代理检索基准中,Qwen2.5-1.5B 和 Qwen2.5-3B 的平均 F1 分数分别为 42.93 和 47.79,而消融验证了 CAPO 的贡献并有利于评估设置中的仅中心优化。我们的代码可在 https://github.com/jianxinke/Harness-RL 获取。