论文

HarnessOpt-Bench:评估LLM的Harness优化能力

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

模型评测智能体系统Agent Harness基准与评测资源

摘要

随着大语言模型(LLMs)在代理系统中的部署,它们的能力不仅依赖于模型权重,还依赖于其周围的提示、工具、控制流、内存和调度代码。这种自动化模型调优——由人工智能系统迭代且受评估指导的模型调优过程——既是提高AI系统的有效途径,也是对AI系统自身的一种挑战性能力。然而,社区缺乏衡量这些前沿LLMs在这一任务上表现如何的标准协议。我们引入HarnessOpt-Bench,这是一个用于昂贵和随机评估的端到端模型调优基准。优化器与带有代码调优工具的LLM一起接收目标代理的种子调优工具、评分反馈以及固定的目标-评价预算。它编辑调优工具并提名最终候选者,后者通过其在保留测试分区上的分数来评估,该分区在整个搜索过程中不可访问。受信任执行环境(Trusted Execution Environment, TEE)确保评估边界,计量目标代理资源使用,并保存候选版本以供审计。我们对5个前沿LLMs作为优化器进行了评估,这些LLMs与4个下游任务的共享代码调优工具和其各自的自然调优工具一起,在111次评分运行中进行评估。实验结果表明,优化模型在通过它们作用于的代码调优工具时分离得比它们自己调优工具更远,自然调优工具并不总是优于标准,且任务间的收益显著不同。这些结果确立了模型调优作为可测量和区分的能力,具有巨大的改进空间。

HarnessOpt-Bench:评估LLM的Harness优化能力:论文配图
图 1:保留线束优化的可信执行。优化器只能编写目标代理的工具。它可以读取评估结果和目标任务数据,但不能修改它们。优化器接收每个案例的开发跟踪和聚合验证指标,而测试用例和分数在受信任的评估服务器后面仍然无法访问。每个候选者都在隔离的、无特权的沙箱中进行评估,并且每个模型调用(优化器自己的和评估的)都通过强制执行模型允许列表和每个范围预算的网关。仅在优化器指定最终候选分区后才会评估测试分区。由于优化器的沙箱中不存在保留数据、提供商凭证和预算执行,因此这些限制是执行环境的属性,而不是优化器预期遵循的指令。