论文
AgentWall:面向本地AI智能体的运行时安全层
AgentWall: A Runtime Safety Layer for Local AI Agents
摘要
自主AI智能体的安全性日益被视为一个关键的开放性问题。随着智能体从被动的文本生成器转变为能够执行shell命令、修改文件、调用API和浏览网页的主动行动者,不安全或被对抗性操纵的行为所带来的后果变得直接而具体。现有的AI安全工作主要聚焦于模型对齐与输入过滤,但这些方法并未解决当智能体的意图在真实机器上变为真实行动的那一刻所发生的问题。这一缺口在本地环境中尤为突出:开发者在其中让智能体接触自己的文件系统、凭证和基础设施,却几乎没有运行时控制手段。本文介绍AgentWall,一个面向本地AI智能体的运行时安全与可观测性层。AgentWall在智能体的每个拟议动作到达宿主环境之前将其拦截,依据显式的声明式策略对其进行评估,对敏感操作要求人工批准,并记录完整的执行轨迹以供审计与重放。它实现为强制执行策略的MCP代理和原生OpenClaw插件,只需一条安装命令即可在Claude Desktop、Cursor、Windsurf、Claude Code和OpenClaw上工作。我们给出AgentWall的设计、架构、威胁模型与策略模型,并在14项基准测试中展示了92.9%的策略执行准确率和亚毫秒级的开销。AgentWall已在https://github.com/agentwall/Agentwall开源。