论文

智能体会梦见root shell吗?LLM智能体在CTF挑战中的部分计分评估

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

智能体系统Agent任务评测

摘要

大语言模型(LLM)智能体日益被提议用于自主化网络安全任务,但其在真实攻击场景中的能力仍鲜为人知。我们提出DeepRed,一个开源基准,用于在隔离虚拟化环境中基于真实的夺旗(CTF)挑战评估基于LLM的智能体。DeepRed将智能体置于配备终端工具和可选网络搜索的Kali攻击环境中,通过私有网络连接目标挑战,并记录完整的执行轨迹以供分析。为超越二元的解出/未解出结果,我们提出一种基于特定挑战检查点的部分计分方法——检查点取自公开writeup——并配套一个先总结后判定的自动化标注流水线,用于从日志中判定检查点的完成情况。利用DeepRed,我们在十个覆盖不同挑战类别的基于虚拟机的CTF挑战上测试了十个可商用获取的LLM。结果表明当前智能体仍然受限:最好的模型平均检查点完成率仅为35%,在常见挑战类型上表现最强,而在需要非标准发现和更长程适应的任务上表现最弱。