论文

GRID:面向安全文本知识图谱构建的情报数据图表示

GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction

上下文与知识知识图谱本体

摘要

安全知识图谱可以为安全代理提供可计算的外部记忆,但从长篇网络威胁情报(CTI)构建它们仍然困难:LLM常常缺乏有根据的安全领域知识,而端到端文档到图谱训练难以用廉价稳定的奖励进行监督。我们提出GRID(Graph Representation of Intelligence Data),一个用于安全文本知识图谱构建的端到端框架。GRID首先从CTI文章构建安全领域监督,通过图抽取和知识图谱条件化文本修订创建可追溯的文章-图谱对齐。随后它把文档到图谱学习转化为一个脚本化任务库,将四选项多选题与三元组级正则匹配目标相结合,相比反复用LLM评审为完整图谱输出打分,能产生更稳定的任务特定奖励。利用该监督流水线,我们训练了两个基于Qwen3-4B-Instruct-2507的4B抽取器:主模型Task-bank Reward模型,以及辅模型End2End Reward模型(使用LLM即评审的精确率/召回率奖励)。在来自GRID、CASIE、CTINexus、MalKG和SecureNLP的249篇CTI文章上,结合本体引导GRID抽取流水线的Task-bank Reward模型达到84.62%的源平均精确率、64.91%的源平均召回率和68.53%的Avg F1,以更低的token用量与部署成本取得最佳源平均召回率和接近最佳的Avg F1。End2End Reward模型达到76.91%精确率、53.85%召回率和58.06%的Avg F1。进一步分析表明,任务库奖励可离线一次性构建并在后续后训练中复用,优于在线端到端LLM即评审奖励以及Choice-only Reward、无RL的End2End SFT等更弱的替代方案。

GRID:面向安全文本知识图谱构建的情报数据图表示:论文配图
图1:Log4Shell(CVE-2021-44228)威胁情报文章的知识图谱(左)与攻击摘要(右)。