论文

CHART:轮换Agent Harness进行课程训练,改善跨框架行为迁移

CHART: A Harness-Rotation Curriculum for Harness-Robust Search Agents

模型训练强化学习

摘要

搜索Agent通常只在一种Harness下训练,而部署后的运行框架会因生产需求频繁更新,例如重写系统提示词。若学到的行为依赖训练时的Harness,即便任务未变,框架更新也可能无法触发该行为。本文训练搜索Agent执行并行搜索,发现固定框架训练会使策略过拟合其表面形式,换框架后退回串行搜索。简单增加框架数量也不能解决:GRPO依赖同一问题并行与串行采样轨迹的奖励差,小框架池很快使差异饱和,大框架池又把每个框架的信号摊得过薄。因此,CHART采用轮换课程训练,让Agent逐步在不同框架下掌握并行搜索。每次定期评估,把已学会预期行为的框架替换为仍可学习的框架,使奖励差异持续存在。在相同初始框架池下,CHART使模型在所有框架中学会并行搜索,静态扩增最多成功一半。未见框架中,CHART在89%的交互轮次并行搜索,静态池最多5%;迁移到新问答任务和搜索环境后,pass@1比最佳静态池高5.6个百分点。CHART训练的Agent还比基线更能受益于元Harness搜索。