论文
度量AI智能体在多步网络攻击场景上的进展
Measuring AI Agents' Progress on Multi-Step Cyber Attack Scenarios
摘要
我们在两个专门构建的网络靶场——32步企业网攻击与7步工业控制系统攻击——上评估前沿AI模型的自主网络攻击能力,两者都要求在长动作序列中串联异构能力。通过比较2024年8月至2026年2月间发布的七个模型在不同推理时算力预算下的表现,我们观察到两条能力趋势。第一,模型性能随推理时算力呈对数线性扩展且未见平台:从1000万词元增至1亿词元带来最高59%的增益,且不需要操作者具备特殊技术手段。第二,固定词元预算下每代模型都超越前代:在企业网靶场,1000万词元下平均完成步数从1.7(GPT-4o,2024年8月)升至9.8(Opus 4.6,2026年2月)。最佳单次运行完成32步中的22步,约相当于人类专家估计14小时中的6小时。在工业控制系统靶场,表现仍然有限,但最新模型首次稳定完成步骤,7步平均完成1.2-1.4步(最多3步)。
