开源项目

exploitbench:评测Agent漏洞利用能力的独立基准

exploitbench/exploitbench

模型评测AI 基础设施Sandbox安全与风险评测Agent Sandbox

概述

exploitbench是一个新创建的安全评测仓库,采用MIT许可,评测对象为Agent在漏洞利用任务上的能力,覆盖从触发漏洞到实现代码执行的完整链路,而非仅考察漏洞识别。对安全团队,这类基准可量化编码Agent与自动化渗透工具的风险等级;对模型方,则是红队评测的补充素材。漏洞利用类评测具有双刃剑属性,使用时须限定在授权与隔离环境中。本次公开材料未披露题目规模与评测指标。