论文
小型可泛化提示预测模型能引导大推理模型的高效 RL 后训练
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
摘要
强化学习(RL)能增强大语言模型的推理能力,但由于 rollout 密集的优化方式,往往伴随高昂的计算成本。在线提示选择是一种可行的解决方案,通过优先处理信息量大的提示来提升训练效率。然而,现有方法要么依赖昂贵且精确的评估,要么构建缺乏跨提示泛化能力的提示专用预测模型。本研究提出可泛化预测提示选择(GPS),它使用一个在共享优化历史上训练的轻量生成模型,对提示难度进行贝叶斯推断。批采集原则中纳入了中等难度优先与历史锚定的多样性,以选择信息量大的提示批次。该小型预测模型还能在测试时泛化,实现高效的计算分配。跨多个推理基准的实验表明,相较更强的基线方法,GPS 在训练效率、最终性能与测试时效率上均有显著提升。
