论文

绘制成本低,信任成本高:验证测试时计算扩展曲线

Cheap to Draw, Expensive to Trust: Certifying Test-Time Scaling Curves

模型评测评测方法与指标

摘要

对多个答案进行抽样并保留验证者得分最高的答案是在测试时购买准确性的最简单方法之一。其效果以缩放曲线的形式报告:准确度与采样答案数量 $k$ 的关系。绘制这条曲线的成本很低,但信任它的成本却很高。预算读数是在查看每个点后选择的,因此只有同时覆盖所有预算的范围才能保护选择,并且在 100 个问题基准上,固定的精确二项式设计需要 192,000 个生成的答案来证明 64 个预算在 95% 的情况下在 $\pm1/32$ 以内。大部分成本都是为了错误的不确定性而付出的。基准是一系列固定的问题;在预算 64 中,选定答案的正确性大约有四分之三的差异存在于问题之间,并且重新审查每个问题的审计不需要为此付出代价。我们推导出验证整个曲线的最小最大成本,直至对数因子。它由三个部分组成:校准分数分布的尾部、区分问题以及沿曲线求和问题内的噪声。在单个基准上,最后一部分锐化了在问题答案的最佳分配下一个答案的影响力的方差,这是每次有效的审计都会支付的,并且随着精度的增长,学习分配的审计会达到对数。基于指数不平等对同一问题进行两次独立抽签的配对审计不需要试点。在 185 个留出集的分数池中,它使用了 64 个预算中最便宜的竞争认证审计答案的 0.74 倍和 1,024 个预算中的 0.53 倍,而在新生成的 MMLU-Pro 研究中,它用 79,133 个答案验证了曲线,与之前根据研究的问题内方差预测的成本法拟合值的 0.6% 以内。相同的路径可以证明通过@$k$ 和多数投票,并且范围扩展到问题群体和依赖于先前问题的答案。