论文
POIROT:审讯智能体以检测多智能体系统中的失败
POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems
摘要
将大型语言模型编入多代理系统(LLM-MAS)已经释放了卓越的推理能力,但抵抗表征的紧急故障和幻觉阻碍了它们在安全关键领域的部署——新兴的人工智能监管在法律上使这一差距变得难以维持。现有的评估范式有一个共同的缺陷:集中判断会造成单点故障,并且需要特定领域的专业知识。在这里,我们介绍 POIROT,这是一种协议,它利用架构中已经存在的认知多样性,将系统自身的代理重新用作其诊断层。在评估的设置中,POIROT 的性能优于单 LLM 评估器基线,其增益随问题复杂性(OR = 1.60,$p = 0.008$)、代理数量和故障维度而变化,并且在复合故障条件下持续存在。这些结果表明,安全监督不需要外部化:执行角色的代理拥有足够的集体智慧来对其进行审计。我们将 POIROT 作为开源库与 BLAME 一起发布,BLAME 是安全关键型多智能体系统中的故障归因基准。
