论文
迈向安全可审计的LLM智能体:统一图表示
Towards Security-Auditable LLM Agents: A Unified Graph Representation
摘要
基于 LLM 的代理系统正在迅速发展,通过动态工具调用、状态内存管理和多代理协作来执行复杂的自主任务。然而,这种语义驱动的执行范式在低层物理事件和高层执行意图之间造成了严重的语义差距,使得事后安全审计从根本上变得困难。现有的表示机制(包括静态 SBOM 和运行时日志)仅提供零散的证据,无法捕获认知状态演化、能力绑定、持久内存污染以及交互代理之间的级联风险传播。为了弥补这一差距,我们提出了 Agent-BOM,这是一种用于代理安全审计的统一结构表示。 Agent-BOM 将代理系统建模为分层属性有向图,它将静态能力基础(例如模型、工具和长期记忆)与动态运行时语义状态(例如目标、推理轨迹和操作)分开。这些层通过语义边缘和安全属性连接,将碎片化的执行跟踪转换为可查询的审计路径。在 Agent-BOM 的基础上,我们开发了一种基于图形查询的范例,用于路径级风险评估,并使用 OWASP Agentic Top 10 对其进行实例化。我们进一步在 OpenClaw 环境中实现审计插件,以从实时执行构建 Agent-BOM。对现实世界代理攻击场景的评估表明,Agent-BOM可以重构隐秘攻击链,包括跨会话内存中毒和工具滥用、能力供应链劫持和意外代码执行、多代理生态系统劫持以及特权和信任滥用。这些结果表明,Agent-BOM 为复杂代理生态系统中的根本原因分析和安全裁决提供了统一且可审计的基础。