论文

Holdout Best-of-N:分离选择分数与评价分数实现无偏评估

Holdout Best-of-N: Unbiased Evaluation and Its Cost

模型评测评测方法与指标

摘要

重复使用选择 Best-of $N$ 获胜者的分数可能会夸大其预期奖励。我们研究了根据每个候选人的 $K$ 独立分数的固定矩阵对使用 $J$ 新鲜分数进行选择的 策略 的评估。当且仅当对于每个池大小 $M\ge N\ge2$ 为 $J<K$ 时,仅基于此矩阵的单个估计器对于每个独立的、稳定的候选者特定得分法则集合下的预期法官奖励是完全无偏的。在 $J=K-1$ 处,选择器随着 $K$ 的增长而加深。对于具有共同方差和固定 $M\ge N\ge2$ 的独立高斯分数,该机制中的无偏最小最大风险的量级为 $σ^2/\sqrt K$,通过 Holdout 获得;允许偏差将速率提高到 $σ^2/K$。对于两个候选者,我们推导出已知方差下的最小方差无偏估计量和尖锐渐近无偏极小极大常量 $1/(π\sqrt2)$,这是 Holdout 在不知道方差的情况下获得的。子集和关系的循环平均值可以在 $O(MK\log M)$ 操作中计算。在固定的选择器深度下,有界分数的循环评估在池大小上具有统一的 $O(K^{-1})$ 风险。不可能的结果涉及固定矩阵:一个额外的新获胜者分数允许对全 $K$ 策略 进行公正的评估。