论文

Risky-Bench:探查真实世界部署下的Agentic安全风险

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

智能体系统Agent任务评测长程任务评测

摘要

大语言模型(LLM)越来越多地被部署为在真实环境中运行的智能体,带来了超越语言层面伤害的安全风险。现有的智能体安全评估依赖针对特定智能体设置定制的风险导向任务,导致安全风险空间覆盖有限,且无法评估智能体在复杂真实部署中进行长程、交互式任务执行时的安全行为。此外,它们对特定智能体设置的专业化限制了跨多样智能体配置的适应性。为解决这些局限,我们提出Risky-Bench,一个以真实部署为基础、支持系统性智能体安全评估的框架。Risky-Bench围绕领域无关的安全原则组织评估,导出刻画安全空间的情境感知安全量规,并通过在不同威胁假设下执行现实任务,系统性地评估该空间内的安全风险。应用于生活助理智能体设置时,Risky-Bench在现实执行条件下揭示了最先进智能体中存在的大量安全风险。此外,作为一个结构良好的评估流水线,Risky-Bench并不局限于生活助理场景,可适配其他部署设置以构建针对特定环境的安全评估,为智能体安全评估提供可扩展的方法论。

Risky-Bench:探查真实世界部署下的Agentic安全风险
图2:Risky-Bench 概览。该框架分三个阶段进行:(1)通过在其部署设置下将安全原则实例化为可操作的细则(rubric),界定 life agent 的安全空间(Sec 2.1);(2)在不同威胁模型假设条件下,在真实任务执行过程中探测 life agent 在所界定安全空间下的安全风险(Sec 2.2);(3)在所界定安全细则的指导下,采用 LLM-as-judge 并辅以人工在环验证来评估 life agent 轨迹(Section 2.3)。