论文

通用智能体评估

General Agent Evaluation

智能体系统Agent任务评测

摘要

通用代理——在不熟悉的环境中执行任务而无需特定领域工程的系统——的承诺在很大程度上仍未实现。现有的代理主要是专业化的,虽然 OpenAI SDK Agent 和 Claude Code 等新兴实现暗示了更广泛的功能,但尚未对其总体性能进行系统评估。当前的代理基准假设特定领域的集成,以妨碍对通用代理进行公平评估的方式编码任务信息。本文将一般智能体评估作为一流的研究目标。我们提出了此类评估的概念原则、支持代理基准集成的统一协议以及 Exgentic——通用代理评估的实用框架。我们在六个环境中对五个著名的代理实现进行了基准测试,作为第一个开放通用代理排行榜。我们的实验表明,通用代理可以在不同的环境中泛化,无需任何特定于环境的调整即可实现与特定领域代理相当的性能。我们发布了评估协议、框架和排行榜,为通用代理的系统研究奠定了基础。

通用智能体评估
图4:Exgentic 架构。Exgentic 在智能体与基准之间定义了一个统一协议。Exgentic Orchestrator 连接智能体与基准,先传递任务定义,随后居中协调在基准与智能体之间传递的观测与动作。Exgentic 提供适配器,将统一协议(Unified Protocol)转换为智能体与基准所需的具体协议。最后,基准提供质量结果指标,而智能体提供智能体运行时成本。