论文

小型可泛化提示预测模型能引导大推理模型的高效 RL 后训练

Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models

模型训练强化学习

摘要

强化学习(RL)能增强大语言模型的推理能力,但由于 rollout 密集的优化方式,往往伴随高昂的计算成本。在线提示选择是一种可行的解决方案,通过优先处理信息量大的提示来提升训练效率。然而,现有方法要么依赖昂贵且精确的评估,要么构建缺乏跨提示泛化能力的提示专用预测模型。本研究提出可泛化预测提示选择(GPS),它使用一个在共享优化历史上训练的轻量生成模型,对提示难度进行贝叶斯推断。批采集原则中纳入了中等难度优先与历史锚定的多样性,以选择信息量大的提示批次。该小型预测模型还能在测试时泛化,实现高效的计算分配。跨多个推理基准的实验表明,相较更强的基线方法,GPS 在训练效率、最终性能与测试时效率上均有显著提升。

小型可泛化提示预测模型能引导大型推理模型的高效 RL 后训练
图1:框架概览。与 MoPPS(Qu et al., 2025b)这类针对特定提示的建模不同,GPS 提出一个可泛化的提示预测模型(PPM)来估计难度并追踪 LLM 的演化。全面的提示批次获取兼顾了中间难度的优先排序与批次级多样性,在缓解 PPM 过拟合的同时提高了 RL 后训练的效率。