多代理 LLM 辩论的顺序共识:具有基于校准的故障检测的 Wald-SPRT 计算调节器
Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection
摘要
多智能体 LLM 辩论提高了事实性和推理能力,但大多数食谱都选择固定的轮数,在简单的项目上花费过多,在困难的项目上花费不足。我们采用 Wald 的顺序概率比测试 (SPRT) 作为 LLM 辩论的插件计算调节器。每轮结束后,LLM 法官都会对最新的代理位置发出 [0,1] 共识分数; Wald 监视器累积 Beta 似然族下“有用收敛”与“尚未有用”的对数似然比,并在跨越任一边界或返回 R_max 处的上限尽力输出时停止。根据 i.i.d.假设规则继承 SPRT I 类/II 类错误保证;在部署中,校准本身是更重要的目标,因为它估计判断分数是否实际上将给定域中的有用收敛与无用收敛区分开来。我们评估两个途径:(i)在校准 Beta 模型下进行蒙特卡罗研究,描述工作曲线、错误率、上限行为和灵敏度; (ii) 使用不相交的 40 项校准子集,使用三个异构代理(gpt-5、claude-opus-4-6、gemini-2.5-pro)和 claude-opus-4-6 判断对 200 个尝试的 MMLU 和 200 个尝试的 GSM8K 项目进行真实的 LLM 评估。在 GSM8K 上,该规则在平均 1.01 轮(4.06 LLM 调用)中停止,准确度为 97.0%,而固定 5 辩论在 15 次调用时为 99.0%:在 -2pp 准确度下,调用减少了 3.7 倍。在 MMLU 上,校准后的 KL 降至 0 左右,并且该规则以 2.1 倍的成本限制 99.5% 的物品。结论并不是 SPRT 使辩论更加准确,而是经典的顺序测试可以作为多智能体 LLM 系统的廉价计算控制和故障检测层。