有多少协调增益是真实的?用于多代理 LLM 基准的配对本底噪声协议
How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks
摘要
多智能体 LLM 协调论文报告了较小的基准增量,作为一种架构优于另一种架构的证据。先前的问题:当两个协议的 API 输入配置等效(通过代码检查加上 SHA-256 字节审计进行匹配)且缺乏完整的身份重放时,两个协议在相同模型和基准上会产生多少配对试验 0 分歧?在 Claude Haiku 4.5 与 tau^2 基准零售上,干净的配置等效对比(no_coord 与截距,在试验 0 中都是惰性的)给出了两个 n=100 种子的 +10pp 和 0pp 的有符号配对间隙;两者合并,+5pp,威尔逊 CI [-2,+12],不显着。最大的单种子对比度(+18pp 拉-截距,p_corr=0.012)在第二个种子(-3pp,p_corr=1.0)处没有重现;在 Bonferroni 后,无论是种子还是合并,试验 0 对比均不显着。观察到的配对间隙的包络跨过两个种子的 [-3,+18]pp,合并的上部 Wilson CI 约为 15pp。最近十个多智能体协调架构中有七个报告了低于该本地层的总体效果,还有一个位于信封内;从构造上看,它们是否能够在同模型配对复制中幸存下来,尚未在其原始设置中进行测试。我们定义协调主动 pass^k,pass^k 仅限于协调机制在逻辑上处于活动状态的试验,作为最小报告协议,在主体中具有样本大小目标和运行时挂钩。测量在 ET-MCP 上运行,ET-MCP 是一个符合 MCP 2026-07-28 的任务范围负知识存储,用作隔离读者端选择的基础,而不是作为贡献。在俳句 4.5 上,候选读者(拉动、拦截)不会改善试验 1 的恢复;我们通过对现有生产吊钩表面的改进,对故障模式进行初步诊断。