论文

CTIFoundry:面向网络威胁情报的智能体原生语料支架

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

上下文与知识上下文工程知识图谱本体

摘要

网络威胁情报(CTI)的消费方越来越不是人类分析师,而是在查询时组合多步调查的LLM智能体。这一转变中harness一侧已迅速成熟(规划循环、工具协议、上下文管理),但语料库一侧没有:威胁报告和漏洞数据库仍按检索增强生成的方式打包,即嵌入索引背后的不透明分块。我们认为,这一基底而非模型能力,才是智能体化CTI调查的瓶颈,并提出CTIFoundry这一智能体原生语料支架。在构建时,CTIFoundry将CTI语料的潜在结构实体化:一个覆盖四个权威知识库(CVE、CWE、CAPEC、ATT&CK)的确定性本体图,其官方交叉引用成为带类型、可遍历的边;一个基于跨度的报告层,其规范化、别名消解后的跨厂商实体为携带溯源信息的分块建立索引;以及混合稠密+词法的检索面。在查询时,这一结构通过七个类型化工具和三个过程性技能暴露给一个原生开源智能体harness。在公开的CTIConnect基准上,仅更换动作面即可使同harness的智能体在四模型、两供应商面板上整体F1提升+0.19至+0.28:CTIFoundry上的小模型超越了平铺基底上的旗舰模型,且这一收益不是以搜索代价换来的,因为在两个Claude模型上,支架化智能体以约一半的工具调用达到更高准确率。消融实验给出归因:类型化结构贡献更大份额,过程性技能把结构转化为纪律,且二者超加性地组合,因为技能只能绑定于确实存在的结构。

CTIFoundry:面向网络威胁情报的智能体原生语料支架:论文配图
(a) (b) 图1:底座带来了什么,又是什么造就了它。(a)在相同装配方式下,智能体在平坦底座与CTIFoundry上的每任务F1,每个模型一个雷达图(§4.3)。(b)CTIFoundry架构:构建时流程,以及由七个类型化工具和每任务族一个技能组成的查询时接口(§3)。