论文
CTFusion:基于 CTF 的 LLM 代理评估基准
CTFusion: A CTF-based Benchmark for LLM Agent Evaluation
摘要
大语言模型 (LLM) 的最新进展使代理系统能够执行复杂的多步骤任务;网络安全正在成为一个突出的应用。为了评估此类代理,研究人员广泛采用夺旗(CTF)基准。然而,当前的 CTF 基准测试重复使用了现有的挑战,这使它们面临数据污染和潜在作弊的风险。值得注意的是,我们通过将网络搜索工具集成到现有代理中,在实践中证实了这些问题。为了解决这些限制,我们提出了 CTFusion,这是一个基于 Live CTF 的流式评估框架。为了实现这一目标,CTFusion 在单个团队帐户下保留每个代理的独立性,并通过仅转发每个挑战的第一个正确标志来减少竞争影响。此外,我们在广泛使用的 CTFd 平台上将 CTFusion 作为模型上下文协议 (MCP) 服务器实现,该平台为不同的 CTF 事件和代理类型提供了广泛的适用性。通过三个 LLM、两个代理和五个 Live CTF 的实验,我们证明现有的 CTF 基准在评估基于 LLM 的代理时可能不可靠,而 CTFusion 可以作为评估网络安全代理的强大解决方案。我们将 CTFusion 作为开源发布,以促进该领域的未来研究。