论文
小语言模型的 GRPO 训练动态
GRPO Training Dynamics for Small Language Models
摘要
组相对策略优化 (GRPO) 已成为一种用于推理密集型任务的内存高效强化微调 (RFT) 技术。然而,对小语言模型(SLM)的 GRPO 训练动态仍然知之甚少,限制了其在开放和资源受限环境中的可靠采用和可重复性。在这项工作中,我们提出了在实际单节点 8xA100 计算预算下对 SLM 的 GRPO 微调的系统研究,参数范围从 1.5B 到 7B。我们的研究跨越多个模型系列和推理领域,包括数学、编码和科学领域的多项选择题回答 (MCQ)。在这些设置中,我们分析了群体规模如何影响策略收敛、训练稳定性和下游基准性能。我们进一步表征 GRPO 训练期间张量级更新动态,并研究 LoRA 目标模块和层的选择是否可以提高 GRPO 调整模型的性能。虽然我们最初的 GRPO 调整模型在大约 80% 的数学基准评估中优于其基础模型,但它们在 MCQ 和代码推理任务上表现出有限的能力。在我们的机制评估的指导下,我们改进了 LoRA 和奖励塑造配置,以提高后面领域的性能。这些发现为 SLM 的 GRPO 训练提供了实用指导。