论文
自我改进系统的可证伪释放门:大规模的常设不变量
Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale
摘要
自我改进代理运行时的安全声明几乎总是自我分级的:策略文件、护栏、自述文件中的承诺。我们描述了可伪造的发布门,这是一种方法,其中每个新功能在发布之前都必须通过预先声明的、机器可检查的验收套件,同时在每个门上保留一组固定的常设不变量。我们在 Antahkarana(一个开放运行时)中实例化它,然后执行方法论文仅通过以下方式进行验证的操作:我们遵循与它增长相同的运行时,并询问保证是否有效。安全关键的属性,即没有控制环铸造的能力词元,任何操作都不会到达效应器,这是对有界模型的可达状态进行彻底的机器检查;故意破坏的模型会产生最短的反例,因此检查器显然有牙齿。然后,我们将运行时进行了六个进一步的版本。在每一个版本中,动作安全不变量 INV-1 到 INV-6 都没有进行任何更改,并且一个版本添加了三种功能,但没有引入新的不变量。在相同的牙齿规则下,又添加了六个经过机器检查的家庭:可证明无法学习的记忆、受管制的智能体、对后量子记录的校准弃权、许多子智能体的控制、自我完善循环本身以及它所产生的内容的驻留。验收套件从 122 项测试增加到 563 项。承载结果处于负空间:在能力增加一倍多的情况下,安全核心既没有被削弱也没有重新设计。最后一个系列是第一个在真实硬件上的系列:门控自我改进将一个小模型的准确率从 20% 提高到 70%,同时自动拒绝只会增加信心的候选模型,整个受控路径每个请求的成本为 0.021 毫秒,模型推理的成本为 0.008%。我们发布了运行时、工具和门套件;每个数字都可以通过一个命令重现。