论文

代理天然免疫系统:架构、分类学和工程

Agent-Native Immune System: Architecture, Taxonomy, and Engineering

智能体系统Agent 动作执行与治理

摘要

从静态聊天机器人到配备持久内存、工具使用协议和多代理协作的自主代理的转变从根本上扩展了人工智能威胁格局。当前的防御机制,例如周边安全和训练时间调整,仍然位于代理的主动推理循环之外。因此,它们存在不足:完全一致的代理仍然非常容易受到内存中毒、工具链操纵或多代理协议攻击等运行时劫持的影响。为了解决这一关键差距,我们引入了代理原生免疫系统(ANIS),这是第一个受生物学启发的内源防御架构,直接嵌入代理的认知循环中。我们的框架提出了四个主要贡献。首先,我们设计了一个六层免疫塔(L0-L5),明确地将屏障免疫(L1)作为非认知的物理和逻辑隔离层。其次,我们建立了代理病毒和代理疫苗的统一分类法,正式明确了表面非参数防御和强大参数疫苗之间的关键区别。第三,我们概念化了“Harness Triad”——元、自我和自动——一种自我监控、元认知自动化支柱,可驱动持续免疫学习(CIL),使疫苗能够动态适应新的威胁。最后,我们在模型对齐和代理免疫之间建立了严格的理论界限:对齐在训练期间提供静态“宪法”价值基础,而 ANIS 在运行时充当动态“执法”机制。最后,我们提出了该领域的开放挑战,包括免疫协议标准化、自身免疫率(假阳性干预率)等新颖的评估指标,以及集体智慧生态系统内病原体和疫苗之间的共同进化动态。