论文
AI红队评估能证明什么、不能证明什么
What AI Red-Team Evaluations Can and Cannot Prove
摘要
AI模型的红队评估能支持某些主张而不能支持另一些,二者之间的边界是可以计算的,而不仅仅是判断问题。我们将评估的证据上限(evidential ceiling)定义为在固定测试预算下单次结果能移动信念的最大倍数,为基准零结果推导出其闭式表达,并用它精确定位该边界。我们发现,在某个可计算的危害率之上,适度规模的基准就能把一个类别认证到既定的证据标准,此时"干净记录"是两种可能观测中更强的一种,其分量超过单次复现的失败。低于该比率时,在固定评分规则与近似独立的试验结构下,任何可行规模的被动基准都无法提供所规定的安全性证据。两种状态之间的交叉点具有闭式表达。该界并不局限于基准:以某个流程在各假设下的条件引出率来表述时,它同样覆盖自适应与自动化红队,并表明决定证据价值的是假设之间的区分度,而非攻击成功本身。对照该边界审计八个评估套件后,我们发现当前基准对高频危害类别是够用的,而对罕见、灾难性的类别则相差好几个数量级。安全基准并非没有信息量。它们对一组具体且可计算的命题提供信息,它们所需要的纪律是明确说明是哪些命题。
