论文

REDAgentBench:大语言模型智能体系统的可执行红队测试与忠实度量

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

大语言模型(LLM)智能体将基于语言的推理与外部工具相结合以执行复杂任务。对抗性输入可以利用智能体与环境之间的交互,使智能体在执行过程中违反安全策略。然而,现有评估常将智能体安全简化为单一的攻击成功率(ASR),把暴露、执行、观察和裁定压缩为一体,可能将实际违规与证据可见性混为一谈。我们提出REDAgentBench,一个用于自主红队测试与忠实度量的可执行框架。它从显式的安全约束及相应的智能体系统漏洞推导攻击,在隔离的服务沙箱中运行这些攻击,并通过服务回执和最终状态变化验证有害影响。该基准包含跨五个服务面的1,661个案例。在六个模型和三种Agent harness(智能体运行框架)上,宏观平均ASR为65.69%;报告的ASR随harness和证据视图而变化,而评估情境的披露会改变执行行为。在一个以状态为依据的诊断队列中,在被确认且动作锚点已解析的违规中,近五分之一发生在智能体已陈述相关约束或风险之后,这揭示出“识别—执行鸿沟”(Recognition–Execution Gap)。最后,一种免训练的策略提醒在匹配回放中将确认违规减少了70个百分点以上。这些发现表明,可执行评估能够改进安全度量并识别可操作的干预点。

REDAgentBench:大语言模型智能体系统的可执行红队测试与忠实度量:论文配图
图1:我们忠实测量框架的动机。在一次普通任务中,被污染的API注入与可信记录冲突的参数。智能体识别出该约束并声称不会执行合并(R=1R{=}1),却仍然执行了有害动作(E=1E{=}1)。因此,轨迹视角可能显示安全,而状态视角确认了危害。这种不匹配催生了我们的忠实测量框架以及识别-执行差距(Recognition–Execution Gap,REG)。