论文
超越RAG的网络威胁情报:图基与智能体检索的系统性评估
Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval
摘要
网络威胁情报(CTI)分析师必须在大量叙述性安全报告集合上回答复杂问题。检索增强生成(RAG)系统帮助语言模型访问外部知识,但传统向量检索在处理需要对威胁行为者、恶意软件、漏洞等实体之间关系进行推理的查询时常常力不从心。这一局限源于相关证据往往分布在多个文本片段和文档之中。知识图谱通过实体与关系的显式表示实现结构化多跳推理,从而应对这一挑战。然而,包括图基方法、智能体方法和混合方法在内的多种检索范式已经涌现,它们具有不同的假设与失败模式。这些方法在真实CTI场景中如何比较、图grounding何时能带来性能提升,目前仍不清楚。我们对四种用于CTI分析的RAG架构进行了系统性评估:标准向量检索、在CTI知识图谱上执行的图基检索、修复失败图查询的智能体变体,以及将图查询与文本检索相结合的混合方法。我们在3,300个CTI问答对上评估这些系统,涵盖事实查询、多跳关系查询、分析师风格的综合问题以及无法回答的情形。结果表明,图grounding能提升结构化事实查询的性能。与向量RAG相比,图-文本混合方法在多跳问题上最多可将答案质量提升35%,同时比纯图系统保持更可靠的性能。