论文

StarHarness:面向企业环境的分层搜索式Harness进化

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

智能体系统Agent HarnessAgent Skills

摘要

我们提出StarHarness,一个在保持模型权重固定的同时进化环境特定智能体运行框架(harness)的框架。进化得到的harness可以包括提示与任务框架、工具接口、技能、由MCP支持的提供方、子智能体结构以及智能体循环配置。StarHarness按基线失败行为对任务分层来构建紧凑的进化池,将对提出者可见的搜索任务与对其隐藏的选择任务分开,并保留留出任务用于评估泛化。在ITBench SRE、EnterpriseOps-Gym ITSM与AutomationBench Finance上,harness进化在每个环境经过4-12个被接受的更改后,将全基准性能较默认harness提升20-35个百分点。这些增益在未参与进化的任务上保持,并在GPT与Qwen模型家族之间无需重新进化即可迁移。轨迹分析将改进与接口修复、环境约定以及能压缩搜索空间的操作知识联系起来,在若干设置中还带来更少的误报诊断与更短的轨迹。因此,StarHarness为减少工具丰富的企业任务中持续存在的模型-环境失配提供了一种实用方法。

StarHarness:面向企业环境的分层搜索式Harness进化:论文配图
图1:StarHarness演进。上:对应工作流。下:可执行过程。提议者读取当前前沿、持久记忆账本与搜索集轨迹,但从不读取选择或保留集轨迹。候选须通过范围限定的验证和一次提议者选定的测试翻转,才进入隐藏的选择评估;被接受的编辑推进已提交的前沿并刷新账本与搜索轨迹。对于树搜索,账本存储候选节点与父链接,而非仅存单一贪心前沿。