论文
审计多智能体LLM推理树优于多数投票与LLM-as-Judge
Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge
摘要
多代理系统(MAS)可以大大扩展大语言模型(LLM)的推理能力,但大多数框架仍然通过多数投票来聚合代理输出。这种启发式方法放弃了推理痕迹的证据结构,并且在虚构共识下是脆弱的,在虚构共识中,代理人共享相关偏差并收敛于相同的不正确的基本原理。我们引入了 AgentAuditor,它用推理树上的路径搜索取代了投票,推理树明确地表示了代理跟踪之间的一致和分歧。 AgentAuditor 通过比较关键分歧点的推理分支来解决冲突,将全局裁决转变为高效的局部验证。我们进一步提出反共识偏好优化(ACPO),它对多数失败案例进行培训,并奖励基于证据的少数选择而不是流行错误。 AgentAuditor 与 MAS 设置无关,我们发现在 5 种流行设置中,与多数投票相比,它的绝对准确率提高了高达 5%,与使用 LLM 作为法官相比,绝对准确率提高了 3%。
