论文
使用支持推理的语言模型进行网络安全检测分类
Cybersecurity Detection Classification with Reasoning-enabled Language Models
摘要
安全运营中心 (SOC) 的一个主要问题是警报疲劳,因为报告的检测数量超出了工作人员在一天内可以分类的数量。之前的工作提示或微调 大语言模型 (LLM) 直接发出分类标签,但没有训练它们推理检测是否是真正的威胁。我们通过将自动提示优化、自我训练和强化学习与可验证的奖励相结合,在真实的、人工标记的 Windows 端点检测上训练一个支持思维链 (CoT) 推理的分类分类器。我们发现 CoT 推理也会降低自动分类所依赖的标签词元概率,因此我们单独训练一个校准器,读取完整的推理轨迹并估计判决正确的概率。我们的系统达到了 82.6% 的测试准确率,并且在管理自动分类的高置信度操作点,与直接标签 LLM 分类器相比,良性召回率提高了 43.0%,恶意召回率提高了 18.3%。我们进一步表明,训练有素的校准器是必要的 - 未经训练的置信度法官将高置信度召回率降至零 - 并且经过微调的 30B 模型显着优于前沿通用模型,从而激发了大规模的有针对性的训练。