论文
AgentCollabBench:诊断好代理何时成为坏合作者
AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators
摘要
多智能体系统通过同行协作实现最先进的成果。然而,当管道中的代理默默地放弃约束时,即使推理链悄悄损坏,系统的最终输出可能看起来是正确的,并且现有的基于结果的评估对这种多跳过程失败视而不见。为了在部署之前测量这些漏洞,我们引入了 AgentCollabBench,这是一个诊断基准,包含 900 个经过人工验证的任务,涵盖软件工程、DevOps 和数据工程。每个任务都会隔离四种行为风险之一:指令衰减(约束是否能够承受同伴压力?)、错误信念传染(谎言是否通过共识传播?)、上下文泄漏(任务之间的信息是否会流失?)以及跟踪器持久性(标记的数据是否到达最终代理?)。通过评估四个现代 LLM(GPT 4.1 mini、Gemini 2.5 Flash Lite、Qwen-3.5-35B-A3B 和 Llama 3.1 8B Instruct),我们公开了仅结果评估不可见的特定于模型的漏洞配置文件;例如,Qwen-3.5-35B-A3B 在示踪剂耐用性和指令稳定性方面领先,而 GPT 4.1 mini 在泄漏遏制和错误信念抵抗方面领先。除了每个模型的差异之外,通信拓扑还成为主要风险因素,它解释了多跳信息生存中 7-40% 的差异。该效应可追溯到聚合 DAG 节点特有的综合瓶颈:权衡竞争父级输入的代理会丢弃少数分支所携带的约束,这是线性链在结构上不存在的瓶颈。 AgentCollabBench 证明,次优拓扑可以默默地消除高性能模型的保障,并认为多智能体可靠性从根本上来说是一个结构性问题,仅扩展模型智能并不能替代架构。