论文
难度缩放的限制:GRPO 调整的 SLM 中硬样本的收益递减
Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs
摘要
最近对 大语言模型 (LLM) 的对齐工作表明,偏好优化可以通过将概率质量转向更好的解决方案来改进推理。我们在资源受限的环境中测试了这一说法,将 GRPO 与 LoRA 应用于 SLM(最高 3B),在 GSM8K 和 MATH 数据集上进行数学推理,并进行难度分层分析。随着问题难度的增加,准确性趋于稳定,从而揭示了能力边界:GRPO 主要重塑输出偏好,而没有可靠地改进最难层的解决方案。与此一致的是,仅针对较低难度的问题训练 GRPO 与各个难度级别的完整数据集准确性相匹配,同时仅使用约 45% 的训练步骤,这表明在此情况下较难样本的回报递减。我们还发现了跨数据集泛化效应:GSM8K 训练的 GRPO 在 MATH 的数值子集上比 MATH 训练的 GRPO 实现了更高的准确度,在 1.5B 时超过约 5%,在 3B 时超过约 3%。我们表明,可实现的最佳收益在很大程度上取决于基础模型的先验推理能力和数据集的难度概况。