论文

通过优先级排序迈向Harness优化器的直接评估

Towards Direct Evaluation of Harness Optimizers via Priority Ranking

模型评测智能体系统Agent Harness智能体自我改进评测方法与指标

摘要

Harness优化通过让一个优化器智能体迭代更新目标智能体的harness来实现智能体的自动化构建。尽管取得了成功,当前研究仅通过观察目标智能体的性能提升来评估优化器。这种间接的端到端改进评估忽略了优化器在中间步骤的动作,而这些动作常常有误并损害智能体性能。因此,harness优化究竟是由优化器知情的更新动作驱动,还是仅仅靠试错,仍不清楚。这使得对harness优化器的直接评估成为必要。然而,由于缺乏最优(oracle)harness,直接评估harness优化器并非易事且成本高昂。为解决这一问题,我们提出一种简单、低成本的直接评估设计,即优先级排序(priority ranking)。该设计要求harness优化器对给定harness中的组件(如工具)按“更新后可能改善或损害智能体性能”的潜力进行排序,从而在步骤层面量化优化器能力,而无需昂贵的rollout或人工检查。更重要的是,优化器的排序表现与其在真实多步harness优化中改进智能体的能力相关,这使优先级排序成为优化能力的可靠预测指标。优先级排序依托Shor实现,这是一个包含182个经人工核验的优化场景的集合,横跨不同领域、设计与时间阶段。代码与数据见https://github.com/k59118/Harness_Optimizer_Evaluation。

通过优先级排序迈向Harness优化器的直接评估:论文配图
图 1:(右)最终改进观察与优先级排名。我们的设计以成本和时间有效且直接地量化优化器的能力,而现有的评估需要运行整个优化过程并提供有限的见解; (左)错误线束更新的示例。