论文
工具规范很重要:揭示并缓解AI Agent的安全风险
Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
摘要
智能体通过扩展大语言模型(LLMs)并引入外部工具,使它们能够执行复杂任务并将其模型输出转化为实际世界的行动。然而,当LLMs作为智能体部署时,它们往往会变得相对不安全,并且这种不安全性的根源尚未得到充分理解。在这篇论文中,我们识别出格式化的工具规格作为智能体安全下降的主要来源,并通过白盒表示分析,展示了它们削弱了模型的内部拒绝信号,并导致了不安全的工具执行。基于这一发现,我们提出了SafeKeep,一种在推理时间点上进行安全判断的保障措施。SafeKeep通过使用扁平化的工具规格进行安全评估,保留了原始的格式化规格以供执行。在两个代表性基准测试中,包括白盒和黑盒模型在内的四款LLMs,SafeKeep将有害请求的平均拒绝率从23.8%提高到70.6%,并在观察级提示注入时,将平均攻击成功率从25.6%降低到2.5%。此外,SafeKeep还超越了现有的保障措施,并保留了任务处理的能力。我们公开了代码和数据,访问地址为https://github.com/snowcatsmoking/SafeKeep。
