论文

审计多智能体LLM推理树优于多数投票与LLM-as-Judge

Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge

模型推理推理验证与自校正

摘要

多代理系统(MAS)可以大大扩展大语言模型(LLM)的推理能力,但大多数框架仍然通过多数投票来聚合代理输出。这种启发式方法放弃了推理痕迹的证据结构,并且在虚构共识下是脆弱的,在虚构共识中,代理人共享相关偏差并收敛于相同的不正确的基本原理。我们引入了 AgentAuditor,它用推理树上的路径搜索取代了投票,推理树明确地表示了代理跟踪之间的一致和分歧。 AgentAuditor 通过比较关键分歧点的推理分支来解决冲突,将全局裁决转变为高效的局部验证。我们进一步提出反共识偏好优化(ACPO),它对多数失败案例进行培训,并奖励基于证据的少数选择而不是流行错误。 AgentAuditor 与 MAS 设置无关,我们发现在 5 种流行设置中,与多数投票相比,它的绝对准确率提高了高达 5%,与使用 LLM 作为法官相比,绝对准确率提高了 3%。

审计多智能体LLM推理树优于多数投票与LLM-as-Judge
图2:AgentAuditor框架的总体架构。给定多agent推理轨迹的候选集合(slate),AgentAuditor执行结构化语义去重,构建由彼此不同的假设组成的紧凑推理树(Reasoning Tree)。随后,它仅审计决策关键的分歧点(Divergence Points),通过比较局部分支证据选出获胜假设,并将其答案传播为最终聚合结果。为使审计可学习,我们在共识陷阱(consensus-trap)实例上使用Anti-Consensus Preference Optimization训练Auditor。