论文
硬预算重复评测中诚实不确定性的紧致极限
Sharp Limits for Honest Uncertainty in Hard-Budget Repeated Evaluation
摘要
重复评测可以准确估计基准分数,但仍需要重复运行来认证狭窄的不确定性。我们在固定网格——M个任务、每任务L条二值路径、硬预算(M+t)K(每条路径最多花费K次响应或回合)——下刻画了这一需求。对固定L≥3和0<α≤1/12,当所有任务都被观测时,最差纯群体上的最优期望宽度为Θ_{α,L}([M(t+1)]^{-1/2});当允许省略任务时为Θ_{α,L}([M(t+√M)]^{-1/2})。下界覆盖自适应硬预算策略,而固定随机子集设计通过分歧证书达到这两个速率。一个联合均值/分歧区间把任务覆盖律转化为实用的有限预算推断。在等预算的LiveCodeBench重放中(16个模型、880个任务、每任务五个输出),任务覆盖设计相对池化均匀采样把中位点估计MSE降低87.0%,而联合证书在15/16个面板中产生更窄的置信区间,中位区间宽度降低30.6%。有限状态分析识别出任务覆盖是在所评估规模下的有效选择,并刻画了群体规模和任务内一致性如何决定有用的工作区域。总体而言,这些紧致规律和固定预算证据使重复运行与任务覆盖成为信息高效重复评测的显式设计变量。