论文

MAS-ProVe:理解多智能体系统的过程验证

MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

模型评测评测方法与指标

摘要

基于大语言模型(LLM)构建的多智能体系统(MAS)在推理轨迹上常表现出高方差。过程验证通过评估轨迹中的中间步骤,已在一般推理场景中展现出前景,并被建议作为引导MAS协调的潜在工具;然而其在MAS中的实际有效性仍不清楚。为填补这一空白,我们提出MAS-ProVe,一项针对多智能体系统过程验证的系统性实证研究。我们的研究涵盖三种验证范式(LLM-as-a-Judge、奖励模型与过程奖励模型),在两个验证粒度层级(智能体级与迭代级)上进行评估。我们进一步考察五个代表性验证器与四种上下文管理策略,并在多个推理基准上对六个多样的MAS框架开展实验。我们发现,过程级验证并不能一致地提升性能,且频繁表现出高方差,凸显了可靠评估部分多智能体轨迹的难度。在所研究的方法中,LLM-as-a-Judge总体上优于基于奖励的方法,其中经过训练的裁判超越通用LLM。我们进一步观察到LLM充当裁判与充当单智能体之间的性能差距较小,并识别出验证中的上下文长度—性能权衡。总体而言,我们的结果表明,面向MAS的有效且稳健的过程验证仍是开放挑战,需要超越当前范式的进一步进展。代码发布于 https://github.com/Wang-ML-Lab/MAS-ProVe。

MAS-ProVe:理解多智能体系统的过程验证
图1:多智能体系统过程验证框架(MAS-ProVe)概览。任何多智能体系统(MAS)的执行都可以抽象为一个统一的工作流程,其中各阶段按顺序执行,而每个阶段内的原子 LLM 调用可以并行运行。MAS-ProVe 通过在两个互补的粒度上执行并行搜索——agent 级(agent-level)与迭代级(iteration-level)——系统性地评估 MAS 与过程验证的结合,同时对过程验证器的选择保持不可知。在验证之前,可以对部分多智能体轨迹应用可定制的上下文管理策略,从而灵活控制传递给验证器的信息以及选择返回给工作流程的最佳候选。