论文
可证明安全的智能体防护栏
Provably Secure Agent Guardrail
摘要
随着大语言模型从受约束的生成式引擎转变为拥有广泛执行权限的智能体,AI失控正在引发人工智能安全的根本性危机。现有防御架构严重依赖经验性语义护栏和概率性的大模型裁决器,这类机制在面对复杂的语义符号解耦攻击时无法提供确定性的安全下界。为了克服这一经验性语义护栏困境,本文基于逻辑推理的根本局限提出了一种新的智能体安全范式。在该范式基础上,我们进一步提出了具有神经符号隔离架构的可执行证明约束动作(Proof-Constrained Action,ePCA)框架。该框架放弃对自然语言的语义信任,强制智能体在执行物理操作之前将自身意图无损地形式化为一阶逻辑数学约束。在宏观与微观二维动态对抗系统上的实证评估表明,我们的形式化验证机制在所有评估场景中实现了零攻击成功率和零误报率,且计算延迟极低。这项研究在明确的系统假设下提供了有条件的形式化基础,并为构建未来智能系统的底层防御基础提供了工程范式。
