论文

GuardianAgentBench:智能体在何处失败以及如何守护

GuardianAgentBench: Where Agents Fail and How to Guard Them

智能体系统Agent任务评测长程任务评测

摘要

随着大语言模型智能体日益以可访问工具与外部环境的方式自主运行,确保其安全可靠行为变得至关重要。我们提出GuardianAgentBench(GABench):一个含580个场景、跨六个域的基准,在三个生产就绪框架(LangChain、LlamaIndex与Vectara)上评估,纳入严格的多阶段验证与五种对抗攻击模式。六个最先进模型的实验揭示:即使最强配置也只达74.8%的总体准确率,并暴露两种不同的失败regime——更强模型少调所需工具,更弱模型错选与多调工具。性能随工具集规模与顺序轮深单调退化,长程规划被证明是更陡的瓶颈。我们的护栏实现跨所有模型一致优于基于系统提示的防御:以仅0.5%的误报率挽回19.9%的失败。结果表明执行时的结构性干预能在不打断正确智能体行为的情况下改善安全。

GuardianAgentBench:智能体在何处失败以及如何守护:论文配图
图 1:幸福路径场景生成管道概述。从代理配置开始,五个阶段产生一个完整的测试用例:用户意图生成、提示生成、工具响应模拟、地面真实轨迹构建和响应评估标准定义。