论文

DUMA-Bench:面向 LLM Agent 安全评测的双控制多智能体基准

DUMA-Bench: A Dual-Control Multi-Agent Benchmark for Evaluating LLM Agent Security

智能体系统Agent任务评测

摘要

基于 LLM 的智能体越来越多地在需要与用户、工具和外部系统交互的环境中运行。然而,大多数安全评估假设用户是被动的、控制是静态的,忽略了塑造真实智能体行为的交互动态。我们提出 DUMA-Bench,一个在双控制(dual-control)交互下衡量智能体安全性的基准与评估协议:智能体与用户都能影响共享环境状态。DUMA-Bench 在 τ²-bench 的基础上扩展了覆盖八类漏洞的对抗环境,包括 RAG 投毒、跨智能体操纵与不安全输出处理。我们在八个领域和多种用户行为模式下,评估来自五个模型家族(OpenAI、Anthropic、DeepSeek、Qwen 等)的 14 个模型。实验表明,引入双控制交互使攻击成功率从 26.9% 升至 41.1%。这些结果说明,智能体安全并非模型单独的属性,而是从模型、用户与环境的交互中涌现。DUMA-Bench 为研究真实智能体部署中的安全问题补上了缺失的评估层。

DUMA-Bench:面向 LLM Agent 安全评测的双控制多智能体基准:论文配图
图 1:DUMA-Bench 中两种评估模式的比较。上:Solo(无用户)评估,智能体直接与环境交互,没有活跃的用户参与者。下:双控制评估,智能体与用户模拟器共同塑造交互轨迹。