论文

Harness-Bench:在真实智能体工作流中跨模型测量执行器效应

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

智能体系统Agent HarnessAgent任务评测

摘要

LLM智能体越来越多地作为可执行系统部署,它们使用工具、修改工作区并产出具体工件。在此类工作流中,性能不仅取决于基础模型,还取决于执行器(harness):管理上下文、工具、状态、约束、权限、追踪与恢复的系统层。然而,现有基准通常将执行抽象掉、比较完整的智能体系统,或固定执行器不变,使执行层差异难以研究。我们提出Harness-Bench,一个用于在真实智能体工作流中评估配置级执行器效应的诊断基准。Harness-Bench在共享的任务环境、预算和评估协议下,跨多个模型后端评估代表性的执行器配置,同时保留各执行器的原生执行行为。该基准包含106个沙盒离线任务,它们基于实际智能体使用模式构建,并经人工审查以确保真实性、可解性、可参照检查性与完整性。每次运行记录最终工件、执行轨迹、用量统计与验证器输出,使分析能够超越最终完成与否。在5,194条执行轨迹上,我们观察到不同模型-执行器组合在完成率、过程质量、效率与失败行为上的显著差异。这些结果表明,智能体能力应在模型-执行器配置层面报告,而非仅归因于基础模型。我们的分析进一步识别出反复出现的执行对齐失败:看似合理的推理与工具反馈、工作区状态、证据或可验证的输出契约脱节。Harness-Bench为诊断和改进可靠、高效、可审计的智能体执行栈提供了可复现的基础。

Harness-Bench:在真实智能体工作流中跨模型测量执行器效应:论文配图
图 1:Harness-Bench 评估流程概述。每个任务都在沙箱中实例化,并由模型线束配置执行。 Harness-Bench 记录工件、跟踪、使用统计数据和验证器输出,然后将完成、过程和安全信号组合成诊断分数。