论文
不要让模型猜测安全性:特定领域人工智能代理的符号护栏
Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents
摘要
人们越来越有兴趣将调用工具的人工智能代理集成到特定领域的商业软件中,其中意外的工具调用可能会导致严重的安全事件。这引起了越来越多的研究关注,并且出现了许多代理安全和安全基准。它们隐含地塑造了社区处理安全问题的方式。然而现有的工作存在一个盲点:它强调基于训练的方法和神经护栏,这减少了不安全或不安全行为的可能性,但不能保证预防它们。它通常忽视了基于标准软件工程实践的演绎、符号护栏的机会,这些护栏可以为某些安全和安全要求提供保证。我们的研究分为三个部分:(1)对 80 个代理安全和安全基准进行系统审查,发现 85% 的基准没有规定可验证的要求(61% 没有提供任何要求,24% 只给出高级目标); (2)对$τ^2$-Bench、CAR-bench和MedAgentBench上哪些安全和安全要求符号护栏可以强制执行和不能强制执行的适用性分析,发现74\%的要求是符号强制执行的,其中95\%只需要简单、低成本的检查; (3)在相同的三个基准上对符号护栏进行实证评估,发现符号护栏在不牺牲实用性的情况下提高了安全性和安全性,并且经常对其进行改进。我们的工作引起了人们对人工智能代理符号护栏潜力的关注,表明它们是在规避风险的商业软件中部署特定领域人工智能代理的一条被忽视但实用的路径。我们在 https://github.com/hyn0027/agent-symbolic-guardrails 发布了所有代码和工件。