AgentS4D:对基于 LLM 的工作区代理的执行生命周期中的运行时风险进行基准测试
AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents
摘要
基于 大语言模型 (LLM) 的工作区代理跨异构资源、外部工具和持久状态执行有状态的多步骤工作流。因此,必须根据整个执行过程中的操作、副作用和状态变化来评估它们的安全性。尽管最近的基准测试具有先进的可执行安全测试和轨迹感知验证,但它们很少提供关于风险进入位置、如何引发不安全行为、对目标造成损害以及执行过程中支持证据出现的位置的统一说明。我们引入了 AgentS4D,这是一个用于全生命周期运行时安全评估的沙盒基准。其四维运行时安全框架使用六个风险输入源、六种归纳策略和九个目标危害来指导案例构建,而七个生命周期检查点则组织运行后证据。 AgentS4D 包含 328 个注入风险的案例。我们在这些案例上评估了四种工具(Hermes、OpenClaw、Claude Code 和 Codex)和五种 LLM 后端(GPT-5.5、Gemini 3.1 Pro、DeepSeek-V4-Pro、MiniMax-M3 和 Qwen3.7-Plus)的所有 20 种组合,产生了 6,560 次运行。总体而言,4,461 次运行 (68.0%) 触发了预先指定的不安全信号。在 20 种配置中,观察到的代理系统安全性随其Harness-LLM 配对以及引入风险的方式而变化。当相同的诱导策略通过不同的风险载体到达代理系统时,代理系统表现出明显不同的安全行为。当同一目标伤害通过不同的载体和策略实现时,它们的反应也不同。此外,4,344 次运行(总共 66.22%)不安全但完整。因此,任务完成无法建立运行时安全性,并且仅测试一种形式的风险可以掩盖重要的弱点。评估应检查不同风险条件下的完整代理配置,并在整个执行过程中保留证据。