论文

AgentTrust:AI智能体工具使用的运行时安全评估与拦截

AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use

智能体系统Agent 动作执行与治理Agent Harness智能体互操作协议MCP

摘要

现代AI智能体通过工具调用(文件操作、shell命令、HTTP请求、数据库查询)执行真实世界副作用。单个不安全动作——意外删除、凭据暴露或数据外泄——即可造成不可逆伤害。既有防御不完整:事后基准在执行后测量行为,静态护栏漏掉混淆与多步上下文,基础设施沙箱限制代码在哪运行却不理解动作含义。我们提出AgentTrust:在执行前拦截智能体工具调用的运行时安全层,返回结构化裁决:允许、警告、阻断或复核。AgentTrust结合shell去混淆规范化器、SafeFix(更安全替代建议)、RiskChain多步攻击链检测,以及面向模糊输入的缓存感知LLM-as-Judge。我们发布覆盖六风险类别的300场景基准,以及额外630个独立构建的真实对抗场景。内部基准上,仅生产规则集在低毫秒级端到端时延下达到95.0%裁决准确率与73.7%风险级准确率。在630场景基准(经修补规则集评估、不声称零样本)上,AgentTrust达96.7%裁决准确率,其中shell混淆载荷约93%。