论文

通过 API 检索和排名量化 LLM 间通信的差异

Quantifying Divergence in Inter-LLM Communication Through API Retrieval and Ranking

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地作为自主代理运行,通过外部 API 推理来执行复杂的任务。然而,它们的可靠性和一致性仍然很差。我们提出了一个统一的基准测试框架来量化 LLM 之间的差异,定义为相同任务下模型在 API 发现和排名方面的差异程度。在 15 个规范 API 领域和 5 个主要模型系列中,我们使用基于集合、排名和共识的指标(包括平均重叠、Jaccard 相似度、排名偏向重叠、Kendall's tau、Kendall's W 和 Cronbach's alpha)来测量成对和组级别的一致性。结果显示总体一致性适中(AO 约为 0.50,tau 约为 0.45),但领域依赖性很强:结构化任务(天气、语音转文本)稳定,而开放式任务(情感分析)表现出较高的分歧。波动性和共识分析表明,一致性聚集在数据绑定域周围,并且抽象推理任务的一致性会降低。这些见解支持多代理系统中的可靠性感知编排,其中共识权重可以改善异构 LLM 之间的协调。除了性能基准测试之外,我们的结果还揭示了多智能体 LLM 协调中的系统故障模式,其中明显的一致性可以掩盖与行动相关的排名的不稳定。这种隐藏的差异带来了部署前的安全风险,并激发了早期检测的诊断基准。