论文

ActiveSaddler:用于AgentHarness优化的自动化课程学习

ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization

智能体系统Agent Harness

摘要

自动化Harness优化可以通过根据执行反馈迭代更新其提示、工具界面和控制逻辑,从而显着改进 LLM Agent。然而,现有方法主要优化Harness的更新方式,同时很大程度上修复了哪些训练场景生成驱动这些更新的反馈。随着Harness的发展,对进一步优化最有用的场景可能会发生变化,这表明训练课程本身应该与Harness一起适应。我们将Harness优化的缺失维度表述为自动化课程学习问题,并引入 ActiveSaddler。 ActiveSaddler 将不断发展的课程建模为具有动态实例化优化目标的非固定老虎机。它将反复出现的故障抽象为可重复使用的故障模式臂,估计进一步针对每种模式的潜在学习进度,并自适应地平衡重新审视已知的弱点与探索新的未知场景。优化结果不断更新已发现的故障模式集及其优先级,从而使课程与Harness共同发展。 GAIA2 和 Terminal-Bench 2.0 上的实验表明,ActiveSaddler 始终发现更强的Harness,与使用优化前固定的场景顺序的相同Harness优化器相比,测试 Pass@1 分别提高了 4.4 和 7.5 个百分点。消融进一步表明,这些收益取决于动态构建优化目标、估计其不断变化的效用以及平衡持续优化与新的故障发现。总之,这些结果将自动化课程学习确立为Harness优化的一个新的关键优化维度。