论文

POIROT:审讯智能体以检测多智能体系统中的失败

POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

模型评测评测方法与指标

摘要

将大型语言模型编入多代理系统(LLM-MAS)已经释放了卓越的推理能力,但抵抗表征的紧急故障和幻觉阻碍了它们在安全关键领域的部署——新兴的人工智能监管在法律上使这一差距变得难以维持。现有的评估范式有一个共同的缺陷:集中判断会造成单点故障,并且需要特定领域的专业知识。在这里,我们介绍 POIROT,这是一种协议,它利用架构中已经存在的认知多样性,将系统自身的代理重新用作其诊断层。在评估的设置中,POIROT 的性能优于单 LLM 评估器基线,其增益随问题复杂性(OR = 1.60,$p = 0.008$)、代理数量和故障维度而变化,并且在复合故障条件下持续存在。这些结果表明,安全监督不需要外部化:执行角色的代理拥有足够的集体智慧来对其进行审计。我们将 POIROT 作为开源库与 BLAME 一起发布,BLAME 是安全关键型多智能体系统中的故障归因基准。

POIROT:审讯智能体以检测多智能体系统中的失败:论文配图
图 1:现有评估范式和 POIROT 替代方案的结构局限性。人工评估、大语言模型法官和单一模型自我评估解决了输出评估的不同方面,但表现出结构性局限性。人工评估提供了针对内存相关错误的鲁棒性,但受到可扩展性和域依赖性的限制。大语言模型作为法官提高了可扩展性,但仍然容易受到上下文饱和、特定领域设计要求和单一评估者偏见的影响。自我评估可以实现迭代细化,但继承了内存限制和集中偏差。 POIROT 引入了一种结构化的多智能体询问协议,该协议将推理分布在智能体之间,并通过协调一致来减轻上下文饱和、可扩展性限制、领域依赖性和单评估者偏差。