pass@k 测不到什么:后训练后的多样性与能力保留
What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training
摘要
pass@$k$ 是模型在 $k$ 采样尝试中解决的问题的比例,是该领域的默认协议,用于确定可验证奖励的强化学习 (RL) 后训练是否改进了模型。在总体水平上,pass@$k$ 仅取决于问题的正确样本概率,而没有关于它如何在输出之间分布的术语。我们表明这种差距不是学术性的。 训练 Qwen2.5-1.5B-使用组相对策略优化 (GRPO) 和拒绝采样微调(模型自己的最短验证者通过的 执行轨迹 上的 RFT、训练)指导小学数学移动三个互补的多样性度量(token 级熵、答案级熵、独特答案)根据提示)在相反的方向上,每臂三颗种子的重叠为零。仅限制验证者正确的完成(控制长度后,GRPO 正确解决方案之间的词汇多样性降低了 15%)和计数控制检查仅隔离错误答案之间的多样性,从而排除了 GRPO 较高的准确性本身来解释这一问题,这一差距仍然存在。然而,pass@8 和 pass@32 在 GSM8K 上没有表现出一致的获胜者,并且硬 MATH-500 子集显示出相同的模式:仅在低 $k$ 处分离。与起始的检查点相比,没有训练有素的手臂显着提高了硬问题覆盖率:RFT 明显更差,而 GRPO 在统计上与 RFT 无法区分 - 因此 GRPO 相对于 RFT 的 pass@1 优势反映了相对于 Base 较小的损失,而不是能力增益,而是失控问题,而不是 pass@$k$ 的失败。在 GSM8K 上,只有 pass@1(在通过构造检测多样性方面没有作用)将手臂完全分开,奖励正确解决方案多样性最少的手臂。我们认为这是标准评估协议缺少通常用于认证的属性的一个具体实例。