论文
语言防火墙:几何作为多智能体系统路由中的防御
Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing
摘要
大型语言模型 (LLM) 的快速集成推动了多代理系统 (MAS) 的发展,在该系统中,专门的代理协作执行复杂的工作流程。这些环境中的有效编排需要强大的路由机制来有效地将任务分配给最合适的代理。然而,现有的路由器从根本上依赖于未经验证的代理,从文本自我描述到静态代理表示,来衡量代理的能力。这种对非经验数据的依赖在代理的预测概况与其实际操作能力之间造成了严重差距,从而引入了严重的安全漏洞。恶意代理可以很容易地歪曲其能力或隐藏隐蔽的后门,从而逃避标准的外部分析和静态表示学习技术。在这项工作中,我们介绍了 ANTAP(自动非文本代理选择器),这是一种评估驱动的路由架构,它放弃间接代理,转而进行主动能力测试。通过动态查询代理以根据经验确定其真实能力,ANTAP 将性能提炼为共享语义空间内的固定行为运算符。在推理时,路由是通过纯粹的非文本代数投影来执行的,建立了一个“语言防火墙”,使基于元数据的攻击无法表达。在我们的实验中,ANTAP 针对基于描述的注入攻击实现了接近于零的 ASR,而基于描述的路由器基线的 ASR 为 67.3\% 及以上。针对自适应嵌入攻击,ANTAP 实现的 ASR 远低于基于嵌入的基线,降低了 20%,同时通过设计保持对描述操作的弹性。
