论文

多Agent AI工作流中的时序攻击模式检测:训练基于轨迹的安全模型的开放框架

Temporal Attack Pattern Detection in Multi-Agent AI Workflows: An Open Framework for Training Trace-Based Security Models

模型训练合成数据

摘要

我们提出一套公开记录的方法论,使用OpenTelemetry轨迹分析微调语言模型,以检测多agent AI工作流中的时序攻击模式。我们整理了一个包含来自18个公开网络安全来源的80,851个样本和35,026条合成OpenTelemetry轨迹的数据集。我们在资源受限的ARM64硬件(NVIDIA DGX Spark)上应用迭代式QLoRA微调,通过三轮训练迭代并进行策略性数据扩充。我们自建基准的准确率从42.86%提升到74.29%,这是一个统计显著的31.4个百分点的提升。针对特定知识空缺的定向样本优于不加区分的扩规。主要贡献包括:(1)面向多agent协同攻击与违规行为的合成轨迹生成方法论,(2)训练数据组成从根本上决定模型行为的实证证据,以及(3)在HuggingFace上完整开放数据集、训练脚本和评测基准。由于误报率的存在,实际部署需要人类监督,这项工作建立了首个可复现的框架,使从业者能够构建适配自身威胁环境的定制agentic安全模型。

多Agent AI工作流中的时序攻击模式检测:训练基于轨迹的安全模型的开放框架 配图
图 1:V2/V3/V4 的训练损失曲线