论文

LLM 代理中的冷启动安全漏洞

The Cold-Start Safety Gap in LLM Agents

智能体系统Agent任务评测

摘要

工具调用 LLM 代理在整个对话过程中是否同样安全?我们发现事实并非如此:代理在会话开始时最容易受到攻击,而在执行一些常规代理任务后会变得更加安全——我们将这种现象称为冷启动安全差距。为了系统地研究这个问题,我们引入了代理安全深度 (SODA),这是一个基准,用于控制代理在遇到安全威胁之前完成多少常规代理任务,最多支持 20 个前述任务。评估 4 个系列的 7 个模型,随着前面的常规代理任务数量从 0 增加到 20,安全性提高了 9--52%。表示分析证实,随着更多先前任务的出现,模型隐藏状态逐渐转向安全对齐区域。通过系统地研究前面对话的哪一部分最重要,我们发现常规代理任务本身是安全的主要驱动因素,而代理自己的先前响应对安全的影响较小,但对于保留以后的效用至关重要。对开源安全基准(AgentHarm、Agent Safety Bench)和实用基准(BFCL、API-Bank)的评估进一步支持了这一结论,证实在部署之前通过常规代理任务预热代理可以使其更安全并保留全部功能。基于这些发现,我们建议采用一种简单的部署策略:让代理在可能暴露于安全关键请求之前完成一些常规代理任务,以减轻冷启动安全差距。我们的代码位于 https://github.com/Trustworthy-ML-Lab/Agent-Cold-Start-Safety-Gap