论文

SafePro:评估专业级AI Agent的安全性

SafePro: Evaluating the Safety of Professional-Level AI Agents

智能体系统Agent任务评测

摘要

基于大语言模型的Agent正迅速从简单的对话助手演化为能够在各领域执行复杂、专业级任务的自主系统。虽然这些进步有望带来显著的生产力提升,但也引入了尚未被充分探索的关键安全风险。现有安全评估主要聚焦于简单的日常辅助任务,无法捕捉专业场景中复杂的决策过程以及失控行为的潜在后果。为填补这一空白,我们提出SafePro,一个旨在评估执行专业活动的AI Agent安全对齐情况的综合基准。SafePro的数据集包含跨多个专业领域、带有安全风险的高复杂度任务,通过严格的迭代创建与评审流程开发而成。我们对最先进AI模型的评测揭示了显著的安全脆弱性,并发现在专业场景中新的不安全行为。我们进一步表明,这些模型在执行复杂专业任务时既表现出安全判断不足,也表现出安全对齐薄弱。此外,我们研究了用于在这些场景中提升Agent安全性的缓解策略,并观察到令人鼓舞的改进。总之,我们的发现凸显了为下一代专业AI Agent打造健壮安全机制的紧迫需求。

SafePro:评估专业级AI Agent的安全性 配图
图 1:SafePro 基准概览。(左)SafePro 数据集包含针对各种专业行业与职业的安全测试,揭示了当前 AI 智能体的重大安全风险。(右)最先进的 AI 模型在 SafePro 基准上表现出较高的不安全率。