论文

KaliBench:Kali Linux 上网络安全工具使用的细粒度基准,具有免运行时可验证的奖励

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

智能体系统Agent任务评测

摘要

大语言模型越来越多地应用于网络安全工作流程,期望将分析师的意图转化为工具调用。然而,现有的评估侧重于基于知识的评估或端到端的agentic任务,并没有直接衡量LLM为现实世界的网络安全工具生成可执行命令的能力。这一差距至关重要,因为网络安全操作依赖于严格的命令行界面 (CLI),其中轻微的语法错误、不正确的标志值绑定或参数错误排序都可能导致执行无效。我们推出了 KaliBench,这是一个用于 Kali Linux 上自然语言到 CLI 翻译的细粒度基准测试和数据集,包含 8,504 个查询命令对,涵盖 23 个功能维度和 5 个安全阶段的 1,642 个工具。 KaliBench 是通过基于手稿的管道构建的,具有确定性规范化和别名感知评估,能够对工具选择和论证构建进行精确且可重复的评估。为了确保语义正确性和实际可执行性,我们开发了一个多阶段验证管道,结合了基于 LLM 的验证、沙盒终端执行和人机循环细化。在这些细粒度、确定性信号的基础上,KaliBench 进一步实现了无需运行时的可验证训练奖励。在三种评估模式和 24 种通用和以安全为重点的开放权重模型配置中,没有一个开放权重模型在不受限制的设置下超过 42% 的精确命令精度,这凸显了在没有明确工具提示的情况下准确使用基于 CLI 的网络安全工具的难度。我们进一步表明,具有来自 KaliBench 的可验证奖励的监督微调和强化学习显着改进了 8B 模型,并实现了与 685B MoE 模型相当的性能。