论文
A²E:端到端Agent审计引擎
$A^2E$ : An End-to-End Agent Auditing Engine
摘要
随着大语言模型(LLM)的快速进步,harness已成为在各领域部署智能体的关键基础设施。快速演进的harness生态也使严格的能力评估愈发重要。然而,高效构建端到端、系统化且全面的评估流水线仍是一项重大挑战。为应对这一挑战,我们提出A²E(Agent Auditing Engine),一个面向agent harness的端到端评估引擎。A²E利用我们新提出的Agent任务协议(ATP),实现评估任务与不同harness的快速集成。通过自动插桩的Monitor,它在实验过程中捕获并生成标准化的执行轨迹。在评估阶段,A²E使用一套多维指标系统性地评估harness能力。相比仅看正确性,这些指标更细粒度地刻画了harness在执行效率、工具使用、任务规划与错误恢复方面的差异。用A²E开展的实验进一步揭示,模型-harness组合在不同类型任务上的表现差异显著,且没有任何单一组合在所有任务上都持续优于其他组合。这些发现不仅证明了系统性评估的必要性,也为模型与harness的协同演进提供了有益指引。代码见 https://github.com/datamllab/A2E。
