论文

验证税:罕见错误制度下人工智能审计的基本限制

The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime

模型评测鲁棒性、公平性与可信度评测

摘要

深度学习中被引用最多的校准结果——CIFAR-100 上温度缩放后的 ECE 为 0.012(Guo 等人,2017 年)——低于统计本底噪声。我们证明这不是实验的失败,而是一个定律:用模型误差率 epsilon 估计校准误差的极小最大率为 Theta((Lepsilon/m)^{1/3}),并且没有估计器可以击败它。这种“验证税”意味着,随着人工智能模型的改进,验证其校准从根本上变得更加困难——相同的指数在相反的方向上。我们建立了四个与标准评估实践相矛盾的结果:(1)没有标签的自我评估提供的校准信息恰好为零,受到独立于计算的常数的限制; (2) 在 mepsilon 大约 1 处发生急剧的相变,低于此值时无法检测到错误校准; (3)主动查询消除了Lipschitz常数,将估计折叠到检测; (4) 验证成本随着管道深度以 L^K 的速率呈指数增长。我们使用来自 5 个系列的 6 个 LLM(8B-405B 参数、27 个基于 logprob 置信度的基准模型对)、95% bootstrap CI 和排列测试来验证五个基准(MMLU、TruthfulQA、ARC-Challenge、HellaSwag、WinoGrande;约 27,000 个项目)。 80% 的配对中自我评价不显着。在前沿模型中,23% 的成对比较与噪声无法区分,这意味着可信的校准声明必须报告验证底线,并在接近基准分辨率时优先考虑主动查询。