论文

SABRE:有状态项目工作空间中 LLM 编码智能体 的操作安全基准测试

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

智能体系统Agent任务评测长程任务评测

摘要

大语言模型 越来越多地被部署为 编码智能体,将安全性从个人响应转移到行动序列。然而,现有的基准主要评估模型是否拒绝不安全的提示,从而很大程度上未检查对有状态工作空间的影响。我们提出了 SABER,这是环境感知操作安全的基准,它将模型放置在现实的代理式项目中,并根据一系列操作后的最终环境状态评估安全性。除了二进制安全违规报告之外,SABRE 还按原因对违规行为进行分类,从而能够分析特定于模型的安全配置文件。我们的评估表明,即使是性能最好的模型,有害安全违规率 (HSR) 也超过 54%,这表明当前的调整对于实际项目环境来说仍然不够。 SABRE 进一步揭示了不同型号的不同安全特征。我们的基准测试可在 https://github.com/sssr-lab/saber 上公开获取。