论文

面向AI控制的可靠性理论

Reliability Theory for AI Control

模型评测评测方法与指标

摘要

可靠性理论为分层系统提供了一套成熟的语言,但其形式化工具尚未成为前沿AI控制的标准。我们将这些工具应用于Google DeepMind对失控部署的防御。同一个控制栈的罕见故障抑制能力可能随其失效域的不同而呈三次、二次或线性阶。Birnbaum重要度指出哪些组件改进能换来最多的名义可靠性,而预防则改变了要求恢复的群体。这些结果为该分离什么、改进什么、测量什么和测试什么提供了具体指导。