论文

不可击穿的安全内核:面向AI智能体及其他可逃逸AI系统的执行时AI对齐

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

智能体系统Agent 动作执行与治理Agent Harness智能体自我改进

摘要

AI智能体被授予工具、API与其他基础设施的访问——使其成为这些系统中的活跃主体。主流方法把控制放进智能体自身运行时:系统提示、输出过滤与护栏库。智能体地址空间中的任何控制都可被影响它的输入触达——这可泛化到任何对自身运行时有足够触达的AI系统——我们把该类命名为可逃逸AI系统。我们识别授权机制为实现架构性控制(而非配合性请求)必须满足的四个性质:进程分离、结构上唯一路径上的动作前强制、请求与系统两级失效关闭——以及可在受控系统信任边界之外验证的外化签名证据。我们把该层定位为执行时AI对齐——补充训练时对齐(RLHF、宪法AI)与推理时对齐。我们提出不可击穿安全内核——实现全部四性质的Rust参考实现。其失效关闭不变量在两级经机器检验:SMT定理(Z3)与生产决策函数的穷尽有界模型检验证明(Kani,4/4测试架)。Python到Rust迁移以字节等价为门(1000/1000固定件;17/17对抗类)。我们评估治理一个活的、可逃逸AI系统(确定性自改进世界模型)的内核——对抗驱动其真实自修改缝隙的逃逸寻求对手:跨1,000次自修改——对安全攸关核心的704次尝试全部被拒——零逃逸;另有在操作员断路开关下的300次同样被拒。另一轮6,240次授权往返零成功绕过。对照3个声称占据智能体控制平面的当代系统——智能体在其中能调用控制;而在这里——它没有这个选择。

不可击穿的安全内核:面向AI智能体及其他可逃逸AI系统的执行时AI对齐:论文配图
图 1:四缝架构。 nginx auth_request、应用中间件、dispatch hook、客户端SDK各自独立拒绝;内核作为一个单独的进程位于它们后面。透明度日志和二进制证明面板(右)实现 P4 并提供外部可验证的证据踪迹。如果内核无法访问,代理进程将拒绝启动:系统级别的“无内核,无代理”。