论文

可复制的共形预测

Replicable Conformal Prediction

模型评测评测方法与指标

摘要

在独立样本上校准同一预测模型的两名分析师每次都会部署不同的预测集,因为校准阈值继承了数据的随机性。无论部署必须跨站点进行审核、缓存或批准,这种不稳定性的代价都是高昂的:没有人可以验证两次校准是否产生了相同的对象。我们问两个问题:独立校准何时可以产生相同的分类器,以及该协议必须花费多少成本?完美一致是不可能的,因为几乎总是返回一个固定答案的过程不可能对每个分布都保持有效,并且通过共享随机性实现的精确一致迫使该过程忽略其数据。共享单个随机种子并将校准阈值四舍五入到粗共享网格可以解决这种紧张局势:部署的分类器在分析师中以任何所需的概率变得相同,覆盖范围保证生存,而代价是集合大小和校准数据的量化增加。匹配下界表明没有任何阈值方法可以支付更少的费用,并且该方法的一个调整常数渐近消失。如果没有任何共享种子,固定网格仍然将所有分析师限制在两个相邻的分类器中,并且没有任何方法可以做得更好。可复制性也阻碍了游戏:在许多重新校准中选择最有利的一个几乎不会移动可复制的分类器,而相同的选择却悄悄地掩盖了标准的共形预测。对真实 ImageNet 输出、四家医院站点分割和四个语言模型系列的实验与理论相符,包括测量的样本成本前沿。