论文

评估上下文协议(ECP):用于 AI 代理评估的便携式合约

The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation

智能体系统智能体互操作协议

摘要

人工智能的发展需要从评估孤立的 大语言模型 (LLM) 到评估自主代理架构的根本转变。本文探讨了评估人工智能代理的关键方法以及先进可观测性基础设施的重要作用。我们分析了代理的架构组件,并确定了当前评估范式的严重局限性,包括基准开发、“确信错误”现象以及理论能力和操作可靠性之间的差异。为了开始解决当前评估基础设施中的碎片化问题,本文提出了评估上下文协议(ECP),这是一个早期阶段的、供应商中立的框架,旨在充当代理系统的可移植评估合同层。当前形式的 ECP 定义了一个小型 JSON-RPC 接口,代理通过该接口公开其用户可见的输出、对其进行的工具调用以及评估者安全的审计上下文,并且可以跨框架和持续集成系统统一运行编程检查。我们描述了一个开源参考实现,其中包括 LangChain、LlamaIndex、CrewAI 和 PydanticAI 的适配器,并且我们根据最近文献中记录的故障模式来定位设计。 ECP 是作为正在进行的工作而不是已完成的标准提出的:随着该协议针对更多系统执行,评估界面、方法集和分级器系列都预计会发生变化,并且证明采用合理性所需的经验验证被概述为未来的工作。