论文

MILO:通过精心策划的多Agent进化实现自动Harness发现

MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

智能体系统Agent Harness

摘要

现代Agentic系统将AI模型与控制执行及环境交互的Harness结合。Harness设计显著影响长程任务表现,但其组合搜索空间需要大量人工探索,并随模型变化重新设计。现有自动方法往往只优化提示或技能等组件,或困于固定、偏重利用的搜索策略。我们提出MILO(Meta-evolutionary Island Orchestration),共同演化Agent Harness及发现它们的搜索策略。MILO结合三部分:(1)基于岛屿树的分层谱系记忆,将被拒绝的变异作为负面证据;(2)每个岛屿的变异Agent依据全局搜索历史和父候选反馈,重写完整Harness;(3)编排Agent通过谱系嫁接与分化、变异Agent重新分配及课程修订调整搜索。在Terminal-Bench 2.1、PaperBench和DeepSWE上,采用前沿模型Opus 4.8和开放权重模型gpt-oss-120b时,MILO发现的Harness优于八种先进Harness和六种搜索方法。使用Opus 4.8时,相较初始Harness,三项任务的解决率分别增加12.0%、28.3%和10.3%,而此前最佳搜索增益分别为4.5%、18.3%和0%。在Terminal-Bench 2.1上,MILO达到86.1±2.0%,超过官方排行榜最高项83.8±2.3%,同时比初始Harness少用26%的词元。在EinsteinArena开放问题中,MILO改进了Erdős最小重叠问题的已知最佳上界(0.3808586→0.3808568),以及第一和第三自相关不等式的上界(1.50274365→1.50274360;1.45081→1.44889)。

MILO:通过精心策划的多Agent进化实现自动Harness发现:图1:MILO元演化Harness发现框架。针对给定Agent,MILO通过两个耦合循环寻找更强的Harness:内循环演化Harness,外循环演化搜索策略。内循环中,(1)从岛屿已接纳的候选中选择父候选;(2)变异Agent根据父候选失败轨迹及包含被拒绝候选的岛屿谱系记忆,重写整个Harness;(3—4)依据多目标Pareto增益评分并决定是否接纳子候选。(5)进展停滞时,外循环编排Agent诊断岛屿,修订变异Agent、记忆和课程。
图1:MILO元演化Harness发现框架。针对给定Agent,MILO通过两个耦合循环寻找更强的Harness:内循环演化Harness,外循环演化搜索策略。内循环中,(1)从岛屿已接纳的候选中选择父候选;(2)变异Agent根据父候选失败轨迹及包含被拒绝候选的岛屿谱系记忆,重写整个Harness;(3—4)依据多目标Pareto增益评分并决定是否接纳子候选。(5)进展停滞时,外循环编排Agent诊断岛屿,修订变异Agent、记忆和课程。