论文
AgentHazard:评估计算机操作智能体有害行为的基准
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
摘要
计算机操作智能体将语言模型从文本生成扩展为对工具、文件与执行环境的持续操作。与聊天系统不同,它们跨交互维护状态,并将中间输出转化为具体动作。这带来了一个独特的安全挑战:有害行为可能通过一系列单独看似合理的步骤逐步显现,包括那些局部看似可接受、但合起来导致未授权操作的中间动作。我们提出AgentHazard,一个用于评估计算机操作智能体有害行为的基准。AgentHazard包含2,653个实例,覆盖多样的风险类别与攻击策略。每个实例将一个有害目标与一串局部合法但联合起来诱发不安全行为的操作步骤配对。该基准评估智能体能否识别并中断源自上下文累积、重复工具使用、中间动作以及跨步骤依赖的伤害。我们在Claude Code、OpenClaw和IFlow上评估AgentHazard,所用的主要是来自Qwen3、Kimi、GLM和DeepSeek系列的开放或可公开部署的模型。我们的实验结果表明,当前系统仍然高度脆弱。特别是,当由Qwen3-Coder驱动时,Claude Code的攻击成功率达到73.63%,这表明仅靠模型对齐并不能可靠地保障自主智能体的安全。
