论文

StepCOPS:用于语言模型策略选择的封闭测试低尾证书

StepCOPS: Closed-Testing Lower-Tail Certificates for Language-Model Policy Selection

模型评测评测方法与指标

摘要

训练后管道必须从许多检查点、提示和解码规则中选择一种语言模型策略。评估者的平均分数可能会掩盖罕见的失败,而同时候选者的置信界限可能会过于保守。我们引入了 StepCOPS,它使用独立的提案分割来为每个候选人提名一个较低的尾部楼层,对新的认证分割进行精确的二项式测试,以及 Holm 的逐步下降程序来认证一组楼层。以至少 $1-\delta$ 的概率,每个经过认证的下限(包括用于政策选择的最大下限)都低于其候选人口的下 $\alpha$ 分位数。此保证假设 i.i.d.评估单元,同时允许候选人之间任意的单元内依赖性。在 24 个预先声明的配置和 11 个基准中,StepCOPS 在 500 次配对试验中获得了 96.4% 的选定策略覆盖率,将认证下限比提案 Bonferroni 和精确 COPS 提高了 1.5 个点,仍然比大参考陪审团预言低 0.6 个点,并在 2.4% 的试验中弃权。影子判断、基准测试、工件和留一判断审计表征了代理边界:保证适用于固定的陪审团分数,而不是直接适用于人类安全。