产品与服务

火山引擎 AgentSentry 披露 Agent 提示词注入四层纵深防护链路(归一化—来源隔离—检测分级—输出行为兜底)

字节实践 | Agent 提示词注入攻击:一场需要长期应对的安全挑战

AI 基础设施上下文与知识智能体系统上下文工程Agent 动作执行与治理Agent Harness智能体互操作协议AI安全与内容治理基础设施MCP

概述

AgentSentry 是火山推出的面向企业智能体的安全防护和统一治理平台,能力覆盖包含资产纳管、权限管控、运行时安全扫描等 8 大能力范围。针对 Agent 提示词注入攻击,其防护链路由四层构成且互为补充:L1 归一化接收用户消息、工具返回值、检索文档、MCP 描述等全部来源输入,执行 URL 编码还原、Unicode escape 还原、HTML entity 还原、Base64 检测与解码、零宽字符与 RTL 控制符等隐形字符移除,输出合规纯文本;L2 来源隔离把系统提示词与开发者配置标记为可信指令,把用户消息、工具返回、检索结果与外部数据标记为不可信数据,供后续审核模块识别风险;L3 注入检测融合规则匹配引擎(高效拦截已知攻击模板、可解释性强)与安全样本专项微调的判别模型(覆盖新型与变异样本),输出分级风险并与系统联动处置;L4 输出行为引入专家模型对 Agent 可触发的全部行为做自动识别与分类标注,结合 L3 的待定风险分级评估,对低风险直接放行、中风险触发二次校验经用户确认后继续、高风险直接拦截指令并中断任务。文中以邮件办公助手遭遇隐藏指令的间接注入场景演示该链路。