论文

AI红队评估能证明什么、不能证明什么

What AI Red-Team Evaluations Can and Cannot Prove

模型评测评测方法与指标

摘要

AI模型的红队评估能支持某些主张而不能支持另一些,二者之间的边界是可以计算的,而不仅仅是判断问题。我们将评估的证据上限(evidential ceiling)定义为在固定测试预算下单次结果能移动信念的最大倍数,为基准零结果推导出其闭式表达,并用它精确定位该边界。我们发现,在某个可计算的危害率之上,适度规模的基准就能把一个类别认证到既定的证据标准,此时"干净记录"是两种可能观测中更强的一种,其分量超过单次复现的失败。低于该比率时,在固定评分规则与近似独立的试验结构下,任何可行规模的被动基准都无法提供所规定的安全性证据。两种状态之间的交叉点具有闭式表达。该界并不局限于基准:以某个流程在各假设下的条件引出率来表述时,它同样覆盖自适应与自动化红队,并表明决定证据价值的是假设之间的区分度,而非攻击成功本身。对照该边界审计八个评估套件后,我们发现当前基准对高频危害类别是够用的,而对罕见、灾难性的类别则相差好几个数量级。安全基准并非没有信息量。它们对一组具体且可计算的命题提供信息,它们所需要的纪律是明确说明是哪些命题。

AI红队评估能证明什么、不能证明什么:论文配图
图 1:证据上限和两种证据制度。 (一)证据渠道。这两个上限都是由渠道和预算确定的;由于数据处理不平等,重新评分或聚合都不会提高。免罪上限 Ceil−\mathrm{Ceil}^{-} 控制认证,对于被动基准,它在 k=0k=0 时获得。 (b) 由单个结果提供的证据(以位为单位),两个量在 r=0.5r=0.5 时针对同一假设对(H0H_{0}:p=r​pup=rp_{u} 与 H1H_{1}:p=pup=p_{u})进行评分。实线表示干净的数据,虚线表示观察到的有害输出。空心圆圈表示推论 1 的传球率。圆圈右侧的零失球是更有力的证据;圆圈右侧的零失球是更有力的证据。向左则不然。随着 pp 的下降,干净的床单携带的证据消失,而单一伤害收敛到 log2⁡(1/r)=1\log_{2}(1/r)=1 位,与 nn 无关。