论文

超越转录文本:检测多Agent潜在通信中的隐蔽合谋

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

模型评测安全与风险评测

摘要

语言模型Agent可以通过公开转录中不可见的连续隐藏状态进行通信,这为隐蔽的有害合谋创造了机会。我们提出可验证潜在对齐(Verifiable Latent Alignments, VLA),一个用于监控和引导这些私有通信通道的激活感知框架。对于每个被监控的决策,VLA用共享事件标识符将私有潜在状态记录和通道状态与由此产生的公开动作关联起来,从而支持匹配的因果分析。我们的第一个贡献是一个仅用中性数据的三层监控器,结合表示异常检测、反事实动作分布影响和稀疏自编码器解释支持。第二个贡献是跨越黑箱行为指令与白箱匹配中性反事实的可引导性框架。第三个贡献是在受控多Agent拍卖基准上的评估,涵盖同构与异构模型对、多Agent可扩展性以及干预有效性。当把文本合谋和潜在合谋行合并为正样本时,顺序监控器在同构Agent上取得平均AUROC 0.993,在异构对上为0.854。在有25-100个竞拍者的Qwen3-0.6B拍卖中,监控只需相对于所有可能有向对很小的归一化负载,而完整的白箱引导实现了100%的出价分布恢复,并把低出价合谋行为降低47.3个百分点。由于完整白箱引导会重放匹配的中性反事实,其精确恢复在构造上就是一个健全性检验。总体而言,这项受控研究表明,所评估的私有通道攻击无需在攻击样本上训练主监控器即可被监控,且在拥有匹配反事实访问时可以被缓解。