论文
超越单代理对齐:防止多代理系统中上下文碎片化的违规行为
Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
摘要
我们识别并形式化了一种新的安全风险:上下文碎片违规(CFV)——一类策略违规,其中个体代理的行为在本地看来是安全合理的,但集体违反了组织策略,因为关键的策略事实被隔离在不同部门的私人上下文中。现有的基于提示的对齐机制和整体拦截器与跨越上下文孤岛的违规行为的匹配度很差。我们提出分布式哨兵(Distributed Sentinel),这是一种分布式零信任执行架构,引入了语义污点词元(STT)协议。通过轻量级 sidecar 代理,我们的系统可以跨组织边界传播安全状态,而无需暴露原始跨域数据,从而实现反事实图模拟以进行跨域策略验证。我们构建了 PhantomEcosystem,这是一个综合基准,包含 9 类真实的跨代理违规场景以及对抗性平衡的安全控制。在此基准测试中,Distributed Sentinel 实现了 F1 = 0.95,端到端延迟为 106 毫秒(A100 上的 16 毫秒验证 + 90 毫秒实体提取),而基于提示的过滤的 F1 为 0.85,基于规则的 DLP 为 0.65。为了凭经验验证外部执行的必要性,我们使用每个代理域世界模型评估了面向执行的多代理工作流程中的八个前沿 LLM。所有模型都表现出很高的违规率 (14-98%),跨域数据流显示出比同域流更高的违规率。这些结果表明,自我回避是不可靠的,多代理安全性受益于在各个代理之上运行的集中执行层。