论文
VulnGym:用于存储库级漏洞检测的基准 编码智能体
VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection
摘要
基于 LLM 的漏洞检测的最新进展已经显示出有希望的结果,而 编码智能体 进一步将这种功能从孤立的代码片段扩展到完整的存储库。这种转变要求代理自主探索存储库并定位与漏洞相关的代码,而不是对预先选择的功能执行检测。然而,现有的基准测试主要侧重于对预选代码片段的漏洞分类,限制了它们在存储库级漏洞检测中评估 编码智能体 的能力。此外,如果没有细粒度的漏洞跟踪注释,检测过程背后的能力限制仍然难以探索。为了解决这些限制,我们提出了 \textbf{VulnGym},这是一个真实世界的存储库级基准,用于评估 编码智能体 的漏洞检测。 VulnGym 将经过审核的 GitHub 公告与其相应的易受攻击版本存储库保持一致。它包含 23 个存储库中的 184 个建议和 408 个漏洞条目,每个条目都注释有行级入口点、关键操作和漏洞跟踪。利用这个细粒度的 真值,VulnGym 定义了一个端到端的检测任务和三个基于预言机的子任务,以共同评估漏洞检测并诊断代码本地化和证据构建中的局限性。我们的评估表明,当前的 编码智能体 在端到端存储库级漏洞检测和准确支持跟踪的构建方面仍然有限。