论文
DUMA-Bench:面向 LLM Agent 安全评测的双控制多智能体基准
DUMA-Bench: A Dual-Control Multi-Agent Benchmark for Evaluating LLM Agent Security
摘要
基于 LLM 的智能体越来越多地在需要与用户、工具和外部系统交互的环境中运行。然而,大多数安全评估假设用户是被动的、控制是静态的,忽略了塑造真实智能体行为的交互动态。我们提出 DUMA-Bench,一个在双控制(dual-control)交互下衡量智能体安全性的基准与评估协议:智能体与用户都能影响共享环境状态。DUMA-Bench 在 τ²-bench 的基础上扩展了覆盖八类漏洞的对抗环境,包括 RAG 投毒、跨智能体操纵与不安全输出处理。我们在八个领域和多种用户行为模式下,评估来自五个模型家族(OpenAI、Anthropic、DeepSeek、Qwen 等)的 14 个模型。实验表明,引入双控制交互使攻击成功率从 26.9% 升至 41.1%。这些结果说明,智能体安全并非模型单独的属性,而是从模型、用户与环境的交互中涌现。DUMA-Bench 为研究真实智能体部署中的安全问题补上了缺失的评估层。
