论文

PerspectiveGap:多代理编排提示的基准

PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting

模型评测基准与评测资源

摘要

现实世界的 LLM 应用程序正在从单代理工作流程转向精心编排的多代理系统,但当前模型仍然难以确定每个子代理需要知道什么。为了衡量这一点,我们引入了 PerspectiveGap,这是一个用于评估 LLM 为多代理系统编写编排提示的能力的基准。 PerspectiveGap 包含 110 个场景,每个场景都通过两种干扰混合任务格式进行评估:角色片段分配和自由形式提示写作。这些场景被组织成 10 种拓扑,这些拓扑是从作者的实际工程实践中提炼出来的,并以“即时经济”原则为框架:构建以循环为中心的编排,以最小的角色和工程开销最大化效用。在对 10 家公司的 33 个商业模型进行的实验中,GPT-5.5 的表现大幅优于所有竞争对手,而 Opus 4.8 尽管编码性能强大,但在编排提示方面表现出明显的弱点。尽管如此,PerspectiveGap 仍然具有挑战性:评估模型的平均综合通过率仅为 17.2\% (GPT-5.5 62.0\%),平均总体泄漏率为 217.9\%(每个场景的信息泄漏事件计数,而不是比例;GPT-5.5 49.1\%)。这些发现表明,多代理编排提示是一种独特且被低估的功能,PerspectiveGap 为系统地测量和改进它提供了基础。