论文
固定部署 pass@k 评估可以识别什么
What Fixed-Rollout pass@k Evaluations Can Identify
摘要
重复采样评估越来越多地推断 pass@k 远远超出每个问题收集的样本数量 n。我们表明,在池化/随机任务条件二项式模型中,固定 n 成功计数仅识别潜在每任务成功分布的 n 个自由矩。因此,对于 k <= n,直接 pass@k 被识别,但对于 k > n,通用外推 pass@k、尾部指数和尾部常数不会被识别,即使在相同的采样预算下有任意多个可交换任务。这比通常的估计量在 n 之外未定义的观察结果更强:它表征了固定深度计数律实验中缺失的信息。我们给出了具有不相容外推的精确的保留计数律的构造,陈述了特殊的唯一扩展情况,并通过豪斯多夫主表示计算了锐群体识别区间。在 Brown 等人发布的针对每个问题 10,000 次采样的公开版本中,反事实 n = 16 评估在 k = 1000 时导致失败,在四个 MATH/GSM8K/CodeContests 配置中,因子从 1.5 到超过 2,600 不明确。校准表明,中等规模的故障份额本身并不能决定宽度。我们的结果并不拒绝参数推理时间缩放定律;它提供了可以评估其假设的非参数基线。我们给出了精确、保守的单坐标有限任务置信度证书和报告标准,将直接估计、识别集和模型条件预测分开。