论文

只为分歧付费:具有匹配标签复杂性界限的模型更新的经过认证的无回归判决

Pay Only for Disagreement: Certified No-Regression Verdicts for Model Updates with Matching Label-Complexity Bounds

模型评测评测方法与指标

摘要

每个生产模型都会通过重新训练、微调、量化或静默供应商交换来更新,并且每次更新都有比它所取代的更糟糕的风险。我们将更新升级正式化为经过认证的配对风险差异审计。我们的出发点是支持恒等式:两个模型之间的风险差异取决于它们不一致的输入,无需标签即可观察到。我们构建了 DISCERN,一个顺序两层协议。零标签层证明良性更新,其不一致率低于单独未标记流量的容忍度。经过审计的层标签仅通过随时有效的置信序列对分歧进行抽样,该序列在每个停止时间和任何标签路由规则下都有效,甚至是对抗性法官。我们在速率水平上证明了有限样本有效性和匹配标签复杂性界限 rho^2/eps^2 ,因此利用自由分歧可以证明比任何配对盲审核员节省了 1/rho 因子,并且保证涵盖了来自一个错误预算的无界促销序列。在超过 785 个更新对的 14,000 多个重播审核流中,包括 LoRA 对语言模型进行高达 1.4B 参数的微调,错误覆盖率为 0.0002(标称 5%),功效为 0.986,零误报,56% 的良性更新证明零标签。每次审核都会发出可机器检查的证据记录,用于上市后监控。