论文面向AI控制的可靠性理论Reliability Theory for AI ControlGrant Molnar·来源日期:2026.09.23模型评测评测方法与指标收藏摘要原文译文可靠性理论为分层系统提供了一套成熟的语言,但其形式化工具尚未成为前沿AI控制的标准。我们将这些工具应用于Google DeepMind对失控部署的防御。同一个控制栈的罕见故障抑制能力可能随其失效域的不同而呈三次、二次或线性阶。Birnbaum重要度指出哪些组件改进能换来最多的名义可靠性,而预防则改变了要求恢复的群体。这些结果为该分离什么、改进什么、测量什么和测试什么提供了具体指导。