论文

SafeFlow:用于阻止多代理系统中恶意传播的语义信息流控制

SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems

智能体系统Agent 动作执行与治理

摘要

多智能体系统通过任务分解和角色专业化来提高能力,但这些相同的机制引入了一个重要的安全盲点:有害的目标可以被分割成局部合理的子任务,从而允许恶意意图逃避任何单个智能体的检测。这是一个日益严重的社会影响挑战:处理敏感信息的系统或相应的工具可能会将常规授权变成未经授权的披露或不安全的行为。我们认为,这种故障模式最好理解为语义信息流问题,而不是单轮提示分类任务。为了解决这个问题,我们提出了 SafeFlow,这是一种多智能体系统的防御框架,它将恶意跨智能体传播形式化为语义信息流问题。 SafeFlow 将结构化语义污点附加到根请求,通过动态协作图传播它们,并执行工作流级验证,以在提交不可逆操作之前重建全局风险上下文。根据涵盖提示注入、基于越狱的不安全工具使用、有风险的代码执行和有害的 Web 代理行为的四个基准进行评估,与未防御的基准和外部防御相比,SafeFlow 降低了攻击成功率,同时保持了较高的良性任务完成率和较高的配对安全-危害成功率。我们的研究结果表明,多代理系统仍然缺乏跨授权边界保存风险语义的机制。这种差距可能会将例行授权变成影响个人和组织的隐私损害或不安全行为。 SafeFlow 使这种风险在整个工作流程中保持可见,避免造成伤害。