论文

ATBench:长期代理安全的多样化且现实的轨迹基准

ATBench: A Diverse and Realistic Trajectory Benchmark for Long-Horizon Agent Safety

智能体系统Agent任务评测长程任务评测

摘要

评估基于LLM的智能体的安全性日益重要,因为现实部署中的风险往往在多步交互中逐渐显现,而非出现在孤立的提示或最终响应中。现有的轨迹级基准仍受限于交互多样性不足、安全失败的可观测性粗糙以及长程真实性较弱。我们提出ATBench,一个用于对智能体安全性进行结构化、多样且逼真评估的轨迹级基准。ATBench从三个维度组织智能体风险:风险来源、失败模式和现实世界危害。基于这一分类体系,我们使用异构工具池和长上下文延迟触发协议构建轨迹,以捕捉跨多个阶段的真实风险显现。该基准包含1,000条轨迹(503条安全、497条不安全),平均9.01轮、3.95k token,共调用1,954个工具,这些工具来自包含2,084个可用工具的工具池。数据质量由基于规则和基于LLM的过滤以及全面的人工审核保障。在前沿LLM、开源模型和专用防护系统上的实验表明,即使对于强大的评估器,ATBench也具有挑战性,同时支持按分类体系分层分析、跨基准比较以及长程失败模式的诊断。

ATBench:长期代理安全的多样化且现实的轨迹基准
图 1:ATBench 概述。左:不安全人员轨迹的三维分类。中:根据完整的交互轨迹进行轨迹级安全判断。右图:一个不安全的示例,其中隐藏的提示注入导致代理跳过验证并将未经验证的社交媒体摘要发布到 Discord。