论文

一次跳转的代价:NLIP 与 A2A 的通信基准

The Cost of a Hop: Benchmarking NLIP and A2A

智能体系统智能体互操作协议A2A

摘要

基于 大语言模型 (LLM) 构建的自治智能体需要标准化协议才能跨系统互操作。目前已有几种协议(A2A、MCP、ACP、ANP、NLIP),但自然语言交互协议 (NLIP) 尚未出现在任何受控性能研究中,也没有任何工作测量智能体协议的延迟花费在哪里。我们根据经验比较 NLIP 和Agent-to-Agent(A2A) 协议,将延迟分解为跨三个独立硬件环境的消息创建、连接和发送阶段。对于轻量级协调,NLIP 在两个环境中比基准 A2A SDK 实现快 8.4-9.6 倍,在第三个环境中快约 4 倍;优势的方向是一致的,其大小取决于硬件。优点是特定于阶段的:对于端到端管道(其中 LLM 推理占主导地位),两种协议表现接近。差异几乎完全来自连接设置。为了测试 A2A 的最佳性能,我们还运行了启用连接缓存的 A2A SDK;缓存缩小了与 NLIP 的差距,具体程度取决于硬件,从一台机器上的 2.75 倍到更快硬件上的接近同等水平,其中缓存优化的 A2A-SDK 在规模上与 NLIP 相匹配。我们将这些报告为测量条件,而没有对剩余发送阶段成本进行单一因果解释。与更优化的 Python-A2A 相比,NLIP 在同一阶段领先约 4 倍。最后,我们提供了一份针对工作负载特征的协议选择指南。

一次跳转的代价:NLIP 与 A2A 的通信基准的原论文方法或结果图
图 1:NLIP 和 A2A 延迟评估的仪器工作流程。在消息创建、客户端连接和发送阶段开始和结束时记录的时间戳产生了整篇论文报告的四个指标。