论文

ANT:多粒度网络流量数据集和智能体行为审计基准

ANT: A Multi-Granularity Network Traffic Dataset and Benchmark for Agents Behavior Auditing

模型评测基准与评测资源

摘要

大语言模型 (LLM) 智能体的日益普及使得网络管理员和安全团队需要审核组织网络内的智能体行为,而无需检查私人用户内容。网络流量提供了可观察的证据来源,但它揭示了多少有关智能体任务和操作的信息仍不清楚。现有的流量数据集缺乏评估该问题所需的联合任务和阶段注释。我们引入了 ANT(智能体网络流量),这是一个数据集,提供智能体风险行为信息、场景和行为原始粒度以及网络流量。 ANT 包含跨 20 个任务和 5 个场景的 3,114 个执行片段,包括 276,417 个双向流和组织成 47 个宏组的 40,049 个行为原语段。我们使用 13 个具有代表性的流量分析基线,建立了智能体风险识别、场景识别和行为原语分类的基准。结果表明,现有方法可以恢复有用但不均匀的行为信号。当恶意工作流程类似于良性任务时,他们很难识别风险,也很难区分具有相似流量模式的场景。原始分类对于频繁的宏组和具有独特流量模式的宏组比对于稀有或语义相似的组更可靠。 ANT 为对网络流量中的智能体行为进行更精确的审核和取证分析提供了通用基础。我们的数据和代码可在 https://anonymous.4open.science/r/ant-main-suite-7BC0/. 获取

ANT:多粒度网络流量数据集和智能体行为审计基准的原论文方法或结果图
图 3:智能体网络流量数据收集系统概述。