论文
LiteEvo:从任务轨迹自动改进可复用Harness
LiteEvo: Automated, Cost-Efficient Harness Evolution for Generalization to Unseen Tasks
摘要
LLM Agent由两件事定义:其模型内部的权重以及围绕模型组装的组件Harness。Harness仍然是手工制作的,而 HarnessX 会自动进化它们,从手工制作的Harness启动每个基准,报告其进化的任务的收益,并为每个基准预算 1亿至1.75亿个元Agent词元。我们提出了 LiteEvo,一种轻量级的Harness进化算法,其免工具元Agent挖掘可重用组件的Agent轨迹,将它们整理到版本化库中,并从中组成每一轮的Harness,从相同的中性Harness开始每个基准测试,并且从不命名基准。 LiteEvo 利用冻结的 Qwen3.5-9B 在五个 agentic 基准的分级任务上进行改进,将 pass@2 提升了 10.5 至 67.7pp,并达到了与 HarnessX 的复制品相当或更高的 pass@2(平均为 71.0 对 67.3),平均API成本降低13.0(原摘要未说明单位)。在训练任务上进化的Harness在四个基准测试中未见过的测试任务中保持了优势,LiteEvo 还将 Claude Code with Sonnet 4.6 提升了 1.2 个百分点至 71.4 个百分点。