论文
在移动边缘训练:在线验证的提示选择,用于大型推理模型的高效 RL 训练
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
摘要
强化学习(RL)对于后训练 大语言模型(LLM)在推理任务中已经变得至关重要。虽然增加轨迹采样可以稳定训练并提高性能,但计算开销是一个关键问题。在 GRPO 等算法中,每个提示的多次轨迹采样会产生高昂的成本,因为大部分提示提供的梯度可以忽略不计,因此实用性很低。为了解决这个问题,我们研究了如何在轨迹采样阶段之前选择高实用性提示。我们的实验分析表明,样本效用是不均匀且不断变化的:最强的学习信号集中在“学习边缘”,即中等难度和高度不确定性的交集,随着训练的进行而变化。受此启发,我们提出了 HIVE(历史信息和在线验证提示选择),这是一种数据高效 RL 的双阶段框架。HIVE 利用历史奖励轨迹进行粗略选择,并采用提示熵作为实时代理来修剪实例通过跨多个数学推理基准和模型评估 HIVE,我们表明 HIVE 在不影响性能的情况下产生了显着的部署效率。