论文
Sapien:用于自主 AI Agent的状态策略引擎
Sapien: A Stateful Policy Engine for Autonomous AI Agents
摘要
上下文安全防御通过综合特定于任务的策略并将其强制执行到Agent的工具调用上,防止人工智能Agent采取恶意行为。然而,在多步骤任务中,哪些操作有效通常取决于Agent已经完成和学到的内容。我们提出了 Sapien,一个用于执行有状态上下文策略的策略引擎。 Sapien 策略使用通过有状态谓词、延迟策略生成和范围语义检查扩展的正则表达式来指定允许的工具调用序列。我们表明,Sapien 的效用与不受约束的智能体的效用相差仅几个百分点。即使Agent被完全劫持,Sapien 的策略也能排除 AgentDojo 上 93-95% 的攻击和 Toolathlon 上 62-85% 的攻击(是长期任务中工具白名单的两倍)。