论文
RobustSGPO:Agent Harness演化的搜索空间控制
RobustSGPO: Search-Space Control for Agent Harness Evolution
摘要
基于语义梯度的提示优化(SGPO)使用执行反馈改进了智能体工具,但其本地更新规则留下了编辑范围和操作的选择未解决的问题。我们引入了 RobustSGPO,它指定请求的编辑、构建和检查补丁,并继续从现有或保留的快照中进行搜索。我们使用 120 个任务、95 次运行和 7,350 次候选尝试来评估 AgentX 头脑风暴工作流程中的权限调度、累积控制和任务族转移。定期 $1\to2\to3$ 调度超出固定最大许可 0.28 测试分数点。 RobustSGPO 在 2000 万Token预算下将 30 项保留任务的完成率从 60.0% 提高到 80.0%,并将测试质量从 3.77 提高到 4.14。类别保留可减少轮班后源任务的降级,而随机保留可达到更高的目标端点。搜索空间控制通过可执行编辑和替代起点来提高质量,并具有可衡量的保留开销。