论文

度量AI智能体在多步网络攻击场景上的进展

Measuring AI Agents' Progress on Multi-Step Cyber Attack Scenarios

智能体系统Agent任务评测

摘要

我们在两个专门构建的网络靶场——32步企业网攻击与7步工业控制系统攻击——上评估前沿AI模型的自主网络攻击能力,两者都要求在长动作序列中串联异构能力。通过比较2024年8月至2026年2月间发布的七个模型在不同推理时算力预算下的表现,我们观察到两条能力趋势。第一,模型性能随推理时算力呈对数线性扩展且未见平台:从1000万词元增至1亿词元带来最高59%的增益,且不需要操作者具备特殊技术手段。第二,固定词元预算下每代模型都超越前代:在企业网靶场,1000万词元下平均完成步数从1.7(GPT-4o,2024年8月)升至9.8(Opus 4.6,2026年2月)。最佳单次运行完成32步中的22步,约相当于人类专家估计14小时中的6小时。在工业控制系统靶场,表现仍然有限,但最新模型首次稳定完成步骤,7步平均完成1.2-1.4步(最多3步)。

度量AI智能体在多步网络攻击场景上的进展:论文配图
图 1:“The Last Ones”(32 步模拟企业网络攻击)完成的平均步骤数与总token支出的函数关系。每条线代表一个不同的模型,阴影区域显示每个token预算下模型之间的最大标准误差。 Sonnet 4.5、Opus 4.5 和 GPT 5.1 Codex 平均 15 次运行高达 10M token; Sonnet 3.7 和 GPT-4o 平均运行 10 次。除 Sonnet 3.7 和 GPT-4o 之外的所有型号均包含 5 次运行,最多 100M token。随着测试token预算的token预算增加,模型继续取得进展。灰色水平线表示攻击链中的重要里程碑。