论文
ForesightSafety-SAGE:面向LLM智能体的全自动场景生成与安全评估
ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents
摘要
大型语言模型 (LLM) 日益从简单的基于文本的交互系统发展为可以维护内存、使用工具、访问外部环境和执行任务的 LLM 代理。随着他们能力和自主权的扩大,他们面临的安全风险也变得更加多样化。现有的评估往往依赖于手动编写的场景、静态提示或最终输出判断,这使得很难捕获智能体在任务执行过程中可能面临的各种风险。我们推出 ForesightSafety-SAGE,这是一个针对 LLM 代理的全自动场景生成和安全评估框架。基于五个风险维度,我们将现实任务执行中抽象且多样的安全风险实例化为1,072个可衡量的评估场景。使用自动评估管道,12 名 LLM 代理在两个权威环境下进行评估。结果显示,当前智能体在任务执行过程中仍面临重大行为安全风险,平均 ASR 为 47.1%,多个模型超过 70%。这些发现证明了可执行的流程级评估对于理解和提高大语言模型Agent安全性的重要性。
