论文

自动化发现没有普遍占优的Agent Harness

Automated Discovery Has No Universally Superior Harness

智能体系统Agent HarnessAgent任务评测

摘要

OpenEvolve、TTT-Discover等自动化发现系统常被作为通用Agent Harness使用,但实际上将存档、父代选择、探索和预算分配等多种设计整合为一套方案。发现过程成本高且具有随机性,过少的独立试验难以区分方法改善与运行波动。论文拆解OpenEvolve式进化搜索及TTT-Discover搜索框架的组成部分,利用超过310万条LLM采样轨迹和重复试验统计分析,在12组模型—问题组合上比较30种预算匹配的Harness。 结果显示这些框架存在泛化问题:在所评估的模型—问题组合中,没有一种固定Harness稳定占优;OpenEvolve的变体通常不如更简单的替代方案。因此,Harness选择更适合作为需要针对问题和基础模型调节的超参数,而非通用方案。作者还发现早期发现进度能预测最终表现,并据此设计相同预算下的自适应分配实验:同时启动多个Harness,淘汰表现较弱的部分运行,再将计算预算分配给较强的运行。该方法优于随机固定选择一种Harness,也优于非自适应的Harness集成。论文发布全部运行样本池,包括每组模型—问题组合的基线零假设分布,供后续方案进行统计比较。