论文

A²E:端到端Agent审计引擎

$A^2E$ : An End-to-End Agent Auditing Engine

智能体系统Agent任务评测

摘要

随着大语言模型(LLM)的快速进步,harness已成为在各领域部署智能体的关键基础设施。快速演进的harness生态也使严格的能力评估愈发重要。然而,高效构建端到端、系统化且全面的评估流水线仍是一项重大挑战。为应对这一挑战,我们提出A²E(Agent Auditing Engine),一个面向agent harness的端到端评估引擎。A²E利用我们新提出的Agent任务协议(ATP),实现评估任务与不同harness的快速集成。通过自动插桩的Monitor,它在实验过程中捕获并生成标准化的执行轨迹。在评估阶段,A²E使用一套多维指标系统性地评估harness能力。相比仅看正确性,这些指标更细粒度地刻画了harness在执行效率、工具使用、任务规划与错误恢复方面的差异。用A²E开展的实验进一步揭示,模型-harness组合在不同类型任务上的表现差异显著,且没有任何单一组合在所有任务上都持续优于其他组合。这些发现不仅证明了系统性评估的必要性,也为模型与harness的协同演进提供了有益指引。代码见 https://github.com/datamllab/A2E。

A²E:端到端Agent审计引擎:论文配图
图2:系统概览。Task整合基准管理与执行支持,Monitor提供统一的智能体接入并对运行时循环进行插桩,Evaluation进行多维评估并集中存储结果。