论文

安全关键 LLM 助手中的 Agent2Agent 威胁:一种以人为中心的分类法

Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy

模型评测智能体系统智能体互操作协议安全与风险评测A2A

摘要

将基于大语言模型(LLM)的对话智能体集成到车辆中,在 Agentic AI、汽车安全与智能体间通信的交汇处带来了新的安全挑战。当这些智能助手通过 Google 的 Agent-to-Agent(A2A)等协议与外部服务协调时,它们建立起攻击面,操纵可以经由自然语言载荷传播,潜在后果严重,从分散驾驶员注意力到未经授权的车辆控制不等。现有 AI 安全框架虽然具有奠基意义,却把被保护的对象(资产)与攻击方式(攻击路径)两类概念混在一起,缺乏安全关键系统工程中严格的“关注点分离”标准。本文通过提出名为 AgentHeLLM(Agent Hazard Exploration for LLM Assistants)的威胁建模框架来弥补这一方法论缺口,该框架将资产识别与攻击路径分析正式分离。我们提出一种以人为中心的资产分类法,它源自面向伤害的“受害者建模”并受《世界人权宣言》启发,还提出一个正式的基于图的模型,区分毒化路径(恶意数据传播)与触发路径(激活动作)。我们通过开源攻击路径建议工具 AgentHeLLM Attack Path Generator 展示该框架的实用适用性,该工具使用双层搜索策略自动化多阶段威胁发现。

安全关键 LLM 助手中的 Agent2Agent 威胁:一种以人为中心的分类法
图6:AgentHeLLM Pathfinder建议攻击路径的概览。该布局展示了图构建工具(左)、带攻击高亮的系统架构(中)以及按成本排序的生成的攻击计划(右)。