论文
Sigma-Hunter:用于威胁搜寻和检测规则生成的领域语言模型
Sigma-Hunter: A Domain-Specific Language Model for Threat Hunting and Detection Engineering
摘要
检测工程师必须将威胁报告、取证观察和搜寻假设转化为精确的、可测试的规则。通用大型语言模型 (LLM) 可以起草此类规则,但通常会产生无效的 YAML、不正确的日志源、不支持的字段或过于宽泛的检测逻辑。本文介绍了 \emph{Sigma-Hunter},这是一种适应领域的 LLM,用于分析师辅助 Sigma 规则生成和威胁狩猎。我们根据 3,635 个经过验证的开源 Sigma 规则构建了一个指令调优数据集,并扩展为 7,663 个问答和分析师推理示例。在此扩展之前,每个源规则都会分配给单个训练、验证或测试分区,因此不会有规则在拆分之间泄漏。我们使用 LoRA 微调 7B Mistral 模型和 Phi-4 模型,并在语法、近似字段一致性以及检测逻辑、完整性、选择性和日志源对齐的语义判断上对保留规则生成进行评分。 Sigma-Hunter-Mistral 的总体得分为 8.17,而最强的通用基线得分为 7.88,未调整的 Mistral 得分为 4.61。有两个发现很突出:领域适应使紧凑的 7B 模型能够在这个结构化任务上与更大的通用模型竞争,并且句法有效性是语义规则质量的弱代理,因为几个基线发出携带弱检测逻辑的格式良好的 YAML。改编后的模型在本地运行,这适合分析师无法访问托管模型服务的离线环境中的检测工程。
