论文
ATBench:长期代理安全的多样化且现实的轨迹基准
ATBench: A Diverse and Realistic Trajectory Benchmark for Long-Horizon Agent Safety
摘要
评估基于LLM的智能体的安全性日益重要,因为现实部署中的风险往往在多步交互中逐渐显现,而非出现在孤立的提示或最终响应中。现有的轨迹级基准仍受限于交互多样性不足、安全失败的可观测性粗糙以及长程真实性较弱。我们提出ATBench,一个用于对智能体安全性进行结构化、多样且逼真评估的轨迹级基准。ATBench从三个维度组织智能体风险:风险来源、失败模式和现实世界危害。基于这一分类体系,我们使用异构工具池和长上下文延迟触发协议构建轨迹,以捕捉跨多个阶段的真实风险显现。该基准包含1,000条轨迹(503条安全、497条不安全),平均9.01轮、3.95k token,共调用1,954个工具,这些工具来自包含2,084个可用工具的工具池。数据质量由基于规则和基于LLM的过滤以及全面的人工审核保障。在前沿LLM、开源模型和专用防护系统上的实验表明,即使对于强大的评估器,ATBench也具有挑战性,同时支持按分类体系分层分析、跨基准比较以及长程失败模式的诊断。
