论文

多智能体系统中潜在通信的安全性

Safety of Latent Communication in Multi-Agent Systems

模型评测安全与风险评测

摘要

潜在通信使多Agent系统能够直接在内部表示空间中交换信息,从而减少基于文本的通信的词元、计算和延迟开销。为此,引入了轻量级可训练链接来将发送者的表示映射到接收者的输入空间。在这项工作中,我们表明,即使是良性链接训练也会增加相对于基于文本的通信的有害合规性,而底层的安全Agent保持不变。攻击者可以通过优化有害查询-响应对上的链接或毒害其他良性训练数据来放大这种影响。我们进一步开发了一种强化学习攻击,可以奖励有害的合规性以及良性的任务表现,而不需要有害的目标响应。在三种通信拓扑和四种安全基准中,这种攻击将平均有害合规分数从经过良性训练的链接的 27.9 提高到了 76.9。与直接监督优化相比,它还在两个良性效用基准上实现了更高的平均精度。将奖励调整为更安全的行为还可以修复受损的链接,从而在不更新Agent的情况下大幅减少所有评估的攻击的有害合规性。总的来说,我们的结果表明,安全调整需要将多智能体系统作为一个整体来考虑。代码:https://github.com/Muhammad-Huzaifaa/latent-safety