论文

你无法逃避自己的激活:评估意识和多代理监控

You Can't Escape Your Own Activations : Evaluation Awareness and Multi-Agent Monitoring

模型评测安全与风险评测

摘要

LLM 代理越来越多地部署在多代理系统中,它们可以在保持良性行为的同时进行串通。旨在检测此类共谋的输出监视器可能会被混淆和隐写术所欺骗,从而促使使用经过内部激活训练的探针。然而,这些探测器通常是在不知道自己正在被监视的代理上进行评估的。我们研究当智能体被明确告知其内部激活正在受到监控时,以及当它们另外收到来自监控器的反馈时,基于激活的检测会如何变化。我们保持模型、探针和阈值固定,只改变代理被告知的内容:什么都没有(基线),激活监视器存在(感知),或者监视器与上一轮的分数一起存在(反馈)。我们使用 Qwen3-32B-AWQ 和 GPT-OSS-20B 在同类和混合配对中测试了两个游戏,一个四代理二十一点游戏和两个代理西蒙斯囚犯游戏。告诉智能体有关监视器的信息并不能隐藏他们。最好的探测器在这三种情况下都能保持准确,而且智能体们会不断勾结。