论文

SWE-Tes​​t:通过输入预测对 LLM 漏洞发现进行基准测试

SWE-Test: Benchmarking LLM Vulnerability Discovery via Input Prediction

智能体系统Agent任务评测

摘要

漏洞发现正在成为 大语言模型 (LLM) 代理的一项重要能力:悄悄错过真正缺陷的代理会导致关键软件暴露。因此,严格衡量这种能力是紧迫的,但现有的基准测试可以通过数据污染、针对不可知的漏洞集进行评分召回、通常依赖于合成错误以及报告无法定位代理失败位置的单个端到端判决来进行游戏。漏洞发现是一种复合能力:代理必须理解源代码、推断输入约束、构造输入、执行它们,并根据反馈迭代纠正。我们将其测量重新定义为具有封闭的、确定性的 真值 的输入预测任务:使用覆盖引导的模糊测试,我们在现实世界的 C/C++ 程序中挖掘深层目标分支,并要求代理预测驱动执行到给定分支的输入。这将发现分解为跨越 15 个领域的 22 个真实 C/C++ 程序的三种任务模式。开环和反馈功能在 16 个代码库(13 个域)中共享 60 个固定目标任务实例,在没有或有远程预言机的情况下测试输入构造,以将代码理解与反馈驱动的校正隔离开来。 Online Arena 取消了预定义的目标,并通过在 11 个程序组成的单独的、部分重叠的池上的覆盖增益来对路径探索进行评分;特工们共同确认了 6 个程序中的 13 个不同的错误。评估 15 个默认努力模型支架配置,在启用反馈的模式下,最好的通过率仅为 55.0%,七对 Claude Code 配置的平均值为 36.4%(带反馈),而没有反馈为 19.3%(通过率)。分解故障,我们发现约束推理,而不是导航,是主要瓶颈。我们发布了带有交钥匙评估环境的 SWE-Tes​​t。