论文

ForestBench:评测多智能体协作的统一图框架

ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration

智能体系统Agent HarnessAgent任务评测

摘要

构建于大语言模型(LLM)之上的多智能体系统(MAS)迅速增多,但其异构的执行轨迹无法为跨方法评估提供共同基础。只看结果的基准丢弃了协作过程,而LLM-as-Judge评估需要额外的、依赖模型的推理,且结果会随所用LLM与评分准则而变化。我们提出一个可泛化的评估框架,将原生的MAS轨迹映射到统一协作图的共享空间,使不同方法能在同一表示、参考集与指标体系下评估。候选图与针对特定查询的参考森林进行比较。每个森林是基准提供的、经核验成功图的集合:它记录了代表性MAS方法完成任务的各种方式,而不是规定唯一最优过程。我们将该框架实例化为ForestBench,从七个公开数据集筛选出844条必须协作的查询,为每条查询预计算十个成功的以目标为条件的参考图,并评估六个代表性MAS框架。受控的骨干、参考图构建与扰动研究检验评估的稳定性与适用范围。基准森林构建完成后,ForestBench可在毫秒内为轨迹评分而无需进一步LLM推理,为比较多样的MAS协作轨迹提供可复用的结构化基础。

ForestBench:评测多智能体协作的统一图框架:论文配图
图1:来自不同MAS方法的原生轨迹是异构的,仅结果(outcome-only)的基准会将其丢弃,而LLM作为裁判则需要反复进行依赖模型的推理。ForestBench将每条轨迹映射为一个协作图,把经验证成功的结构视为参考树,这些参考树共同构成参考森林,并使用结构化指标将候选图与该森林进行比较。