论文
Evo-Bench:语言模型可以改善智能体的利用吗?
Evo-Bench: Can Language Models Improve Agent Harness?
摘要
大语言模型 (LLM) 推动了自主代理的快速进步,但标准评估仍然仅限于静态任务解决。一个新兴的前沿领域是Harness进化——智能体自主优化其自身操作Harness的能力。然而,系统地对这种能力进行基准测试仍然具有挑战性,因为现有的评估无法将Harness改进与基础模型强度分开,防止特定任务的过度拟合或捕获长期迭代研究。为了应对这些挑战,我们推出了 Evo-Bench,这是第一个基准测试,旨在评估模型在搜索、Office 和一般代理领域的内在驾驭进化能力。为了严格隔离这种能力,Evo-Bench 采用了一种新颖的Harness引导构建框架:它利用辅助任务演化来识别对框架改进真正敏感的任务,然后进行敏感度感知分层分割,以确保强大的跨套件泛化。对 9 个前沿模型和开放权重模型的广泛评估表明,顶级模型取得了巨大的绝对收益,达到 16.6 分,非常接近最先进的人类工程基线。至关重要的是,虽然自主进化在一般任务中优于人工利用,并且在搜索任务中表现出色,但在需要高度具体的处理工作流程的 Office 任务中却表现不佳。此外,我们的分析揭示了关键的时间异常,例如早期饱和,同时证明综合工具充当高度可转移的推理结构,持续推动多样化的政策模型。