论文

评测编码 Agent 的内核漏洞利用生成能力

Evaluating Coding Agents on Kernel Exploit Generation

智能体系统Agent任务评测

摘要

编码 Agent 已能在生产软件中发现真实漏洞。然而,漏洞发现结果并不能衡量 Agent 能否构造漏洞利用原语。我们提出 KEX-bench,一个评测编码 Agent 针对真实操作系统内核生成漏洞利用原语能力的基准。KEX-bench 包含覆盖 40 个 Linux 与 Windows CVE 的 45 个任务实例,涵盖内核地址泄露、指令指针控制、堆读、堆写与任意地址写。每个任务在隔离虚拟机中运行,暴露受控工具,并使用确定性验证器检查特定原语的成功。我们在固定工具调用预算下评估与前沿及开放权重模型配对的最先进编码 Agent。在没有参考概念验证(PoC)时,最强配置解决 20 个 Windows 任务中的 1 个(5.0%)和 25 个 Linux 任务中的 14 个(56.0%);有参考 PoC 时,最强配置解决 45 个任务中的 31 个(68.9%)。这凸显了一个差距:Agent 能触发内核崩溃,却无法把内核状态塑造成漏洞利用原语。我们发布 KEX-bench 以支持 AI 辅助漏洞利用的可复现研究,见原文链接。

评测编码 Agent 的内核漏洞利用生成能力:论文配图
图 3:token 与开销画像。每列展示一个平台与 PoC 设置下最强的智能体—模型配置。上:按结果划分的 token 用量。下:运行时间与 token 的关系,标记大小表示工具调用次数。Tokens 横轴以百万为单位。Windows w/o PoC 使用 ClaudeCode/Opus 4.6,两个 Codex 配置同样以 1/20 并列。