论文
HarnessBandit:多工具代理强化学习的联合可学习性-可迁移性调度
HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning
摘要
语言模型代理越来越多地通过不同的工具进行部署,这些工具在系统提示、工具模式、控制循环和轨迹格式方面有所不同。同一模型在这些接口上的表现可能不均匀,因此利用变化的鲁棒性成为一个重要目标。一种自然的方法是通过多个Harness训练共享策略,但这样做会带来调度问题:每个训练步骤都应该有利于当前提供有用学习信号的Harness,同时还生成有利于其他Harness的更新。我们开发了 HarnessBandit,这是一种在线调度程序,可为每个优化器步骤选择一个Harness。在进行组相对策略优化 (GRPO) 更新后,它会观察可学习性(批次上的平均绝对优势)和可转移性(当前Harness的低维梯度草图与剩余Harness的指数移动平均值之间的余弦)。这两个信号在合并滑动窗口最小-最大归一化后融合,并使用依赖于访问的奖励和显式探索层进行采样。我们在 ClawGym 上通过六个Harness训练 Qwen3.5-2B,并在 PinchBench(保留任务、分布中的 OpenClaw)和 ClawEval(保留任务和Harness)上进行评估。 HarnessBandit 在两个基准上都比混合批次多Harness训练有所改进,而训练诊断表明可学习性和可转移性提供了独特的、不断变化的信号。