论文
通过多智能体可解释性检测多智能体合谋
Detecting Multi-Agent Collusion Through Multi-Agent Interpretability
摘要
随着 LLM 代理越来越多地部署在多代理系统中,它们引入了可能逃避标准形式的人类监督的秘密协调风险。虽然模型激活的线性探针已显示出在单代理环境中检测欺骗的前景,但共谋本质上是一种多代理现象,并且使用内部表示来检测代理之间的共谋仍有待探索。我们引入了 NARCBench,这是一种评估环境分布变化下共谋检测的基准,并提出了五种探测技术,这些技术可以汇总每个代理的欺骗分数,以在组级别对场景进行分类。我们的探针在分布中实现了 1.00 AUROC,当零样本转移到结构不同的多智能体场景和隐写二十一点算牌任务时,实现了 0.60--0.86 AUROC。我们发现没有一种探测技术在所有共谋类型中占主导地位,这表明不同形式的共谋在激活空间中表现不同。我们还发现初步证据表明,该信号局限于token级别,共谋代理的激活在处理其合作伙伴消息的编码部分时特别明显。这项工作朝着多智能体可解释性迈出了一步:将白盒检查从单一模型扩展到多智能体环境,其中检测需要跨智能体聚合信号。这些结果表明,模型内部为文本级监控提供了补充信号,用于检测多智能体共谋,特别是对于有权访问模型激活的组织而言。代码和数据可在 https://github.com/aaronrose227/narcbench 获取。
