论文
二值化使分数空间变平
Binarization Flattens the Score Space
摘要
大语言模型(LLM)评审通常被用作奖励,以针对确定性验证者无法捕获的目标来训练策略。然而,这些奖励通常会折叠为通过/失败 ({0, 1}),它报告结论,但不报告响应满足每个标准的程度。我们将每个通过/失败判定建模为未报告的评分,并与一个截止值进行比较。该范围的延伸使每个分数按比例接近或远离截止值,但永远不会跨越它,因此判决不会改变。因此,策略可以自由地应用任何延伸,而不改变专家组报告的任何内容。在联合高斯模型下,第三级添加了第二个阈值并消除了这种仿射拉伸模糊性。在一位七标准评委的 MATH 和 SciBench 输出中,所有 14 个构建的标准拉伸在二值化后都是不可见的,但在三个等级时可见。在 $n=1{,}024$ 时,根据两个总体定律进行的测试在 $1.5\times$ 压力下具有至少 96.5% 的功效。保留成绩可以弥补二值化造成的盲点,但仅靠判断仍然不够,因为一些变化与真正的改进仍然难以区分。这些包括任意的等级内变化和固定协方差、负载对齐均值偏移——专家组将其视为能力的阿谀奉承型提升的标志。共享因子参考近似值适合 MATH 和 SciBench,但不适合 HealthBench,从而描绘了其经验范围。我们建议保留至少三个等级(例如,询问评审每个标准是否完全、部分或未满足并奖励 {0, 0.5, 1}),并通过外部验证检查剩余方向上的增益;进一步细化评分尺度也无法消除该方向的歧义。