论文

集成 LLM 用于生成 AI 增强网络安全软件需求

Ensembling LLMs for AI-Augmented Cybersecurity Software Requirements Generation

模型推理推理验证与自校正

摘要

将高级控制从安全标准转化为具体的系统特定要求是网络安全需求工程的核心。 大语言模型 (LLM) 可以加速这项劳动密集型、召回敏感的任务,但任何单次运行都是不可靠的:它在引入似是而非的幻觉的同时错过了有效的保障措施,并且输出在运行和模型之间发生变化。我们将这种可变性重新定义为一种资源:我们不是选择一个输出,而是研究后生成集成,使用信息检索数据融合算子聚合随机运行。我们提出两种策略:统一融合仅奖励交叉运行协议,而朴素贝叶斯融合则根据估计的可靠性对每次运行进行加权。我们评估了四个模型系列中 12 种配置的超过 24 次运行,这些运行是针对 10 个 ISO/IEC 27002:2022 控制生成的,并根据 72 项有效要求的人工标准进行了专家评审。汇集每次运行的输出可以恢复全部72项有效要求(而单一配置平均恢复不到一半),但也可以恢复 111 个幻觉。融合将小麦与谷壳分开,将有效需求排在幻觉之前。在精确率-召回率和 ROC 曲线下的区域中,仅均匀融合就大大超过了每个原始运行和配置,比最佳配置高出 0.142 和 0.118。朴素贝叶斯加权进一步增加了 0.039 和 0.052,达到 0.864 和 0.869,同时更早地获得有用的操作点。内部验证证实了这些增益的稳定性:它们在至少 92% 的袋外引导重采样和每个结构化扰动样本中保持正值。因此,后代融合将明显的噪音变成了实用的资产:一个轻量级的层,为分析师提供了更广泛的覆盖范围和更好的优先审查队列,仅使用负担得起的、低于前沿的模型。