论文
可用的护栏:验证跨 ML 系统的选择性预测
Available Guardrails: Certifying Selective Prediction across ML Systems
摘要
选择性预测器充当安全门:仅当预测看起来足够可信时,它才返回输出。部署越来越需要针对每个感兴趣的报告单元(例如工具、策略标签或患者亚组)以目标精度对这种可靠性进行认证。主要的困难往往不是授予的证书是否有效,而是有限的校准数据是否可以产生证书。随着大门变得更安全或更细粒度,一些单位可能收到的证据太少而无法证明。我们通过经典的精确二项式反演使这种可用性概念可计算,并在固定的组顺序下制定报告分区选择,作为一个动态程序,公开安全性、粒度和服务流量之间的权衡。由此产生的边界揭示了有限样本估计几乎消除的大量人口机会:一个知情的规划者在支持平衡上获得了 0.157 美元的平均覆盖率,而一个天真的估计者仅恢复了 0.005 美元,这使得从有限数据中恢复成为核心挑战。在一个规划分割上构建候选分区并在另一个规划分割上进行选择可以弥补这一差距的一部分,将支持平衡的平均覆盖率提高 0.060 美元,方向在三个意图路由数据集和两种架构中以 60 美元模型效果中的 59 美元再现。一个补充性的有效性保持杠杆,在报告单位之间重新分配家庭误差预算,恢复了人口数量和噪声估计的额外覆盖范围。在大语言模型工具调用、内容审核、病变分类和推荐中,同样的边界会重复出现,并具有特定于预测器的上限。因此,经过认证的可用性是一种可规划的部署资源,它决定何时可以对安全门进行认证、以何种粒度以及在多少流量上进行认证。