NiyamAI:基于零知识证明、防护栏可密码学验证的意图绑定AI智能体
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs
摘要
具备工具执行能力的自主LLM智能体通过提示词注入、目标劫持与未授权动作调用带来严重安全风险。现有防护栏依赖未经验证的主机本地软件过滤器——系统提示词、语义分类器、策略引擎——它们与不受信任的智能体共享执行环境,无法向外部观察者保证安全策略得到了正确评估。被攻陷的主机不会产生自身失效的证据。本文提出NiyamAI,一种为自主智能体提供密码学可验证执行完整性的意图绑定运行时防护架构。在会话初始化时,允许的工具与运行约束经SHA256承诺封存为不可变的意图契约(Intent Contract)。每次工具调用都被一个确定性权限门拦截,并由专用神经Judge(11->8->2前馈网络)分类。对每个被授权的动作,NiyamAI生成简洁的zkSNARK证明,认证其在已承诺契约下经过了正确的策略评估;只有证明验证通过后才会执行。在2,000个AgentSafetyBench场景、5折分层交叉验证与折外评分下,NiyamAI在1.0%误报率下取得88.8%的F1(bootstrap 95%置信区间[85.5%, 92.1%]),对比Llama Prompt Guard 2的66.8%、GPTOSSSafeguard的46.2%与NeMo Guardrails的40.4%;McNemar精确检验确认每个差距的p < 0.0001。每个获批动作的证明生成增加1.7秒,验证为51毫秒,18.6 KB的证明可被任何第三方在无需访问模型参数的情况下验证。我们进一步用六类18个对抗向量测试NiyamAI自身的执行机制,披露了开发期间识别并修复的两个实现漏洞。