论文

FuzzingBrain-Bench V1:评估LLM的开放式漏洞发现

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs

智能体系统Agent任务评测

摘要

评估大语言模型(LLM)发现软件漏洞的能力日益重要。现有基准通常通过要求模型生成触发预定义目标漏洞的概念验证输入来评估这一能力。然而,这种设置可能忽视模型发现的与预定义目标不匹配的有效崩溃。因此,评估可能无法反映模型的真实能力。我们提出FuzzingBrain-Bench,一个评估AI模型在开源软件中发现漏洞能力的基准。模型会获得一个开源项目和一个带净化器插桩的harness,封装在自包含Docker镜像中。其目标是通过该harness生成触发尽可能多不同崩溃的输入。模型在每个挑战上的表现按其产生的不同崩溃签名数量评分,以预定义最大值为上限并乘以难度系数。FuzzingBrain-Bench V1包含来自43个开源项目的77个挑战,其中36个C、32个C++和9个Java/JVM挑战。我们在完整基准上评估了Claude Haiku 4.5、Claude Sonnet 4.6和Claude Opus 4.8。Claude Opus 4.8表现最佳,在77个挑战中的60个上触发崩溃,取得579分中的196分。三个模型均未能在13个挑战中触发崩溃。FuzzingBrain-Bench语料和harness公开发布于https://github.com/fuzzingbrain/FuzzingBrain-Bench。

FuzzingBrain-Bench V1:评估LLM的开放式漏洞发现:论文配图
图8:在各难度等级D1–D5崩溃的挑战数(括号内为各等级规模),阴影表示各等级中崩溃挑战的占比。