MILO:通过精心策划的多Agent进化实现自动Harness发现
MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution
摘要
现代Agentic系统将AI模型与控制执行及环境交互的Harness结合。Harness设计显著影响长程任务表现,但其组合搜索空间需要大量人工探索,并随模型变化重新设计。现有自动方法往往只优化提示或技能等组件,或困于固定、偏重利用的搜索策略。我们提出MILO(Meta-evolutionary Island Orchestration),共同演化Agent Harness及发现它们的搜索策略。MILO结合三部分:(1)基于岛屿树的分层谱系记忆,将被拒绝的变异作为负面证据;(2)每个岛屿的变异Agent依据全局搜索历史和父候选反馈,重写完整Harness;(3)编排Agent通过谱系嫁接与分化、变异Agent重新分配及课程修订调整搜索。在Terminal-Bench 2.1、PaperBench和DeepSWE上,采用前沿模型Opus 4.8和开放权重模型gpt-oss-120b时,MILO发现的Harness优于八种先进Harness和六种搜索方法。使用Opus 4.8时,相较初始Harness,三项任务的解决率分别增加12.0%、28.3%和10.3%,而此前最佳搜索增益分别为4.5%、18.3%和0%。在Terminal-Bench 2.1上,MILO达到86.1±2.0%,超过官方排行榜最高项83.8±2.3%,同时比初始Harness少用26%的词元。在EinsteinArena开放问题中,MILO改进了Erdős最小重叠问题的已知最佳上界(0.3808586→0.3808568),以及第一和第三自相关不等式的上界(1.50274365→1.50274360;1.45081→1.44889)。
