论文
LLM 安全工具编排的决定因素和限制:HexStrike-AI 的研究
Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI
摘要
通过模型上下文协议驱动安全工具套件的 大语言模型 代理越来越普遍。然而,限制其能力的因素仍然不明确:多少取决于模型与驱动它的客户端,将代理限制在编排者自己的工具上是否有帮助,以及能力在哪里受到推理而不是缺少工具的限制。我们使用 HexStrikeAI(一个公开了 150 多种工具的开源编排器)作为测试平台,遵循评估系统、诊断其故障并应用有针对性的改进的方法。我们在三种工具访问机制和三种模型/客户端配置下运行了 7 个类别和 3 个难度级别的 86 个 picoCTF 挑战(774 次试验)。然后,我们对现有工具、代理行为更改和十一个新功能工具进行更正,并重新运行之前不成功的试验。诊断将驾驶客户端隔离为固定模型(两个 DeepSeek 客户端之间的 2.1 * 差距)和单调难度梯度的一阶因素,其中中间层的增益最大。总体解决率从 55.4% 上升到 72.0%,并且每种配置都显着提高(配对 McNemar p < 0.001,不重叠的 95% 置信区间)。剩余的失败是推理或环境限制的,而不是缺少工具。 60 次运行的稳定性子研究发现单次运行的结论是可重复的(17/20 一致)。我们讨论了结果对于如何评估此类协调器意味着什么,并且我们明确了限制:该研究使用单一基准,修复程序根据评估的相同挑战进行调整,并且仅针对一个模型证明了客户端效应,因此它对其他模型的普遍性仍然是一种假设。