论文

利用Agentic AI的提示注入缓解、嵌套学习与经语义缓存实现的AI可持续性

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

模型评测评测方法与指标

摘要

提示注入仍然是大语言模型安全部署的核心障碍,在中间输出可能传播或放大恶意指令的多智能体环境中尤甚。在先前提出四指标总注入脆弱性评分(TIVS)的工作基础上,本文以基于语义相似度的缓存和第五个指标(可观测性评分比)扩展评估框架,得到 TIVS-O,并在一个受 HOPE 启发的嵌套学习架构中研究防御效果与透明度如何相互作用。所提出的系统把 agentic 管线与实现语义相似度缓存的 Continuum Memory Systems 相结合,处理取自十个攻击家族的 301 个合成生成的注入类提示,同时第四个智能体使用五个关键性能指标执行综合安全分析。除传统注入指标外,OSR 量化每个智能体暴露的安全相关推理的丰富度与清晰度,从而能够显式分析严格缓解与可审计性之间的权衡。实验表明,该系统在零高风险违规的情况下实现安全响应,而语义缓存带来可观计算节省:LLM 调用减少 41.6%,延迟、能耗与碳排放相应下降。五种 TIVS-O 配置揭示了缓解严格性与取证透明度之间的最优权衡。这些结果表明,可观测性感知的评估能揭示多智能体管线内的非单调效应,且记忆增强智能体可以在不修改底层模型权重的情况下,同时最大化安全鲁棒性、实时性能、运营成本节省与环境可持续性,为安全且绿色的 LLM 部署提供可上生产的路径。

利用Agentic AI的提示注入缓解、嵌套学习与经语义缓存实现的AI可持续性
图14:语义缓存带来的计算节省:基线系统需要 903 次 LLM 调用(301 个提示 × 3 个智能体),Nested Learning 架构仅需 527 次实际调用(节省 376 次,计算成本降低 41.6%)。