论文

候选供给与答案选择塑造多智能体系统中LLM裁判的价值

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

智能体系统Agent 协作

摘要

多智能体系统(MAS)有时已具备答对的潜力,却仍报告错误答案。解释这一结果很困难,因为生成、通信与最终答案选择规则通常同时变化。我们将多智能体推理概念化为候选生成、同侪通信与终端选择的演化流水线,其中缺乏质量控制的一致可能表现出模因漂移模式。我们研究两个问题:(1)LLM裁判何时通过为MAS中生成的候选提供答案正确性信号而形成有效选择压力;(2)使用该信号何时能改善最终报告的答案。为刻画裁判可靠性,我们分析了来自MMLU-Pro、GPQA、MedXpertQA与MuSR的15,336个问题,并单独分析了Humanity's Last Exam。为检验这些规则,我们回放了来自五个基准16,278个问题的81,390个固定候选池。我们报告三个发现:(1)正确答案常常已在生成的候选之中,但系统仍可能收敛到并报告错误答案;(2)裁判可靠性不是模型的固定属性,而是随任务、生成器以及正确答案的稀有程度而变化;(3)把答案频率与裁判评估结合只改变了最终答案选择规则,就将准确率从63.82%提升至70.82-70.95%,主要靠挽救那些被流行错误答案在数量上压倒的正确答案。在所研究的系统中,生成更多候选的价值取决于这些额外样本能否让正确答案变得存在、频繁或可识别。通过隔离生成、识别与选择环节,这些发现为设计能保护已生成正确答案不丢失的多智能体架构奠定了诊断基础。