论文
不可击穿的安全内核:面向AI智能体及其他可逃逸AI系统的执行时AI对齐
The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems
摘要
AI智能体被授予工具、API与其他基础设施的访问——使其成为这些系统中的活跃主体。主流方法把控制放进智能体自身运行时:系统提示、输出过滤与护栏库。智能体地址空间中的任何控制都可被影响它的输入触达——这可泛化到任何对自身运行时有足够触达的AI系统——我们把该类命名为可逃逸AI系统。我们识别授权机制为实现架构性控制(而非配合性请求)必须满足的四个性质:进程分离、结构上唯一路径上的动作前强制、请求与系统两级失效关闭——以及可在受控系统信任边界之外验证的外化签名证据。我们把该层定位为执行时AI对齐——补充训练时对齐(RLHF、宪法AI)与推理时对齐。我们提出不可击穿安全内核——实现全部四性质的Rust参考实现。其失效关闭不变量在两级经机器检验:SMT定理(Z3)与生产决策函数的穷尽有界模型检验证明(Kani,4/4测试架)。Python到Rust迁移以字节等价为门(1000/1000固定件;17/17对抗类)。我们评估治理一个活的、可逃逸AI系统(确定性自改进世界模型)的内核——对抗驱动其真实自修改缝隙的逃逸寻求对手:跨1,000次自修改——对安全攸关核心的704次尝试全部被拒——零逃逸;另有在操作员断路开关下的300次同样被拒。另一轮6,240次授权往返零成功绕过。对照3个声称占据智能体控制平面的当代系统——智能体在其中能调用控制;而在这里——它没有这个选择。
