论文
遏制验证:独立于对齐的AI安全保证
Containment Verification: AI Safety Guarantees Independent of Alignment
摘要
代理框架是人工智能代理在世界中行动的软件层。现有的安全方法会干预模型,因此仍然以学习行为的不可验证属性为条件。我们引入了遏制验证,它将安全保证置于代理框架本身中。在破坏预言语义下,人工智能被建模为覆盖整个类型化动作空间的不受约束的预言,并且经过验证的包含层必须对每个可能的人工智能输出强制执行边界策略。对于通过建模边界事件、动作参数和状态来表达的边界可执行属性,我们通过前向模拟细化证明了通用保证,并在 Dafny 中将其机械化。我们通过验证 PocketFlow(一个极简代理 LLM 框架)来实例化范例,并使用代理合成管道在针对同义反复规范的信息障碍下生成规范、操作模型和细化证明。据我们所知,这是代理框架的第一次演绎形式验证,并且它的保证对于建模类型化动作边界上的建模能力是不变的。