AgentTrust:面向AI智能体动作的自改进信任层
AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions
摘要
人工智能代理越来越多地采取相应的行动——shell命令、云操作和任意工具调用——因此信任层必须针对每个行动决定是否允许、警告、阻止或升级。我们认为,推理这一层的正确方法是按威胁类型。词汇(固定签名)威胁,其中危险存在于稳定的令牌中,可以通过确定性规则来判定;语义(意图相关)威胁,即良性和恶意行为共享同一表面,是构建规则无法触及的。我们用反面证明来具体说明这一点:一个确定的、手工编写的云规则包总体上仅将保留的准确性提升了 48% 至 56%,并将语义类别移动了 0pp(data_db 29 至 29,可观察性 59 至 59,supply_chain 50 至 50),而强大的 LLM 法官则准确地执行了这些类别。我们为法官提供了自学习能力:在主要是语义攻击的语料库上,它的规则准确性几乎翻倍(48% 到 83.6-85.2%),错误块几乎为零,这适用于两个模型提供者。我们将其转变为一个自我改进的双存储系统:法官在词汇威胁上提炼出不断增长的确定性规则层(随着时间的推移会更便宜),并为语义威胁提供受保护的 RAG 内存(判决缓存失败——表面双胞胎崩溃到约 58%——因此佐证守卫将语义准确性提高了 +13pp,从 70 到 84)。其结果是 AgentTrust v2 与其静态 v1 前身不同:一个从自己的决策流中自我演化的信任层 - 在词汇类上更便宜(它提取自己的规则),在语义类上更智能(它产生受保护的先例),同时从不硬阻止良性操作。端到端在线重播显示,判断调用率下降(50% 至 44%),判断域准确率上升(71% 至 80%),45,000 个操作中出现 0 个良性硬块。