论文
更聪明的破坏者,更好的修复者:线性多代理工作流程中的扩展和安全性
Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows
摘要
随着基于 LLM 的多智能体系统 (MAS) 在野外部署,其协作结构针对对抗性妥协的弹性成为一个关键的安全问题。攻击者可能会利用提示注入或越狱来破坏 MAS 工作流程中的各个代理,但模型扩展和系统级弹性之间的相互作用仍然知之甚少。本文研究了模型规模如何影响线性多智能体工作流程的安全性。我们在 HumanEval 基准上对两个开放权重模型系列进行的实验揭示了合规性校正对称性:较大的模型更有可能忠实地执行恶意指令,在未校正的管道中,控制到恶意的性能下降在 27B 时达到 53.7pp。然而,附加一个轻量级终端 Fixer 阶段会将其压缩至 0.6pp,并恢复与控制级性能的统计对等性,这表明严格的线性协作结构对于这种规模的对手来说是可行的且具有弹性,并表明之前归因于线性拓扑的脆弱性可能源于缺乏校正。