论文
MAS-ProVe:理解多智能体系统的过程验证
MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems
摘要
基于大语言模型(LLM)构建的多智能体系统(MAS)在推理轨迹上常表现出高方差。过程验证通过评估轨迹中的中间步骤,已在一般推理场景中展现出前景,并被建议作为引导MAS协调的潜在工具;然而其在MAS中的实际有效性仍不清楚。为填补这一空白,我们提出MAS-ProVe,一项针对多智能体系统过程验证的系统性实证研究。我们的研究涵盖三种验证范式(LLM-as-a-Judge、奖励模型与过程奖励模型),在两个验证粒度层级(智能体级与迭代级)上进行评估。我们进一步考察五个代表性验证器与四种上下文管理策略,并在多个推理基准上对六个多样的MAS框架开展实验。我们发现,过程级验证并不能一致地提升性能,且频繁表现出高方差,凸显了可靠评估部分多智能体轨迹的难度。在所研究的方法中,LLM-as-a-Judge总体上优于基于奖励的方法,其中经过训练的裁判超越通用LLM。我们进一步观察到LLM充当裁判与充当单智能体之间的性能差距较小,并识别出验证中的上下文长度—性能权衡。总体而言,我们的结果表明,面向MAS的有效且稳健的过程验证仍是开放挑战,需要超越当前范式的进一步进展。代码发布于 https://github.com/Wang-ML-Lab/MAS-ProVe。
