论文
Risky-Bench:探查真实世界部署下的Agentic安全风险
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
摘要
大语言模型(LLM)越来越多地被部署为在真实环境中运行的智能体,带来了超越语言层面伤害的安全风险。现有的智能体安全评估依赖针对特定智能体设置定制的风险导向任务,导致安全风险空间覆盖有限,且无法评估智能体在复杂真实部署中进行长程、交互式任务执行时的安全行为。此外,它们对特定智能体设置的专业化限制了跨多样智能体配置的适应性。为解决这些局限,我们提出Risky-Bench,一个以真实部署为基础、支持系统性智能体安全评估的框架。Risky-Bench围绕领域无关的安全原则组织评估,导出刻画安全空间的情境感知安全量规,并通过在不同威胁假设下执行现实任务,系统性地评估该空间内的安全风险。应用于生活助理智能体设置时,Risky-Bench在现实执行条件下揭示了最先进智能体中存在的大量安全风险。此外,作为一个结构良好的评估流水线,Risky-Bench并不局限于生活助理场景,可适配其他部署设置以构建针对特定环境的安全评估,为智能体安全评估提供可扩展的方法论。
