论文
卡尔曼满足课程:自适应 RL 微调的高效动态提示选择
Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning
摘要
强化学习(RL)微调显着增强了大语言模型(LLM)的推理能力,但其有效性关键取决于为当前策略选择适当难度的提示。这是具有挑战性的,因为在整个训练过程中,即时困难会不断变化。因此,现有的在线方法面临着一个权衡:基于评估的方法准确但昂贵,而基于预测的方法虽然有效,但通常假设平稳困难,这使得它们不适合强化学习的非平稳训练动态。为了解决这些问题,我们提出了卡尔曼引导提示选择方法(KGPS),它将提示选择重新表述为动态状态估计问题而不是静态难度预测。 KGPS 使用线性高斯状态空间模型对 logits 空间中每个提示的潜在成功率进行建模,其中过程噪声与策略更新的幅度耦合,以便当策略变化更大时不确定性会增加。然后,卡尔曼滤波器在提示难度上维持校准的高斯后验,并通过最大化后验预期训练效用来选择提示,该训练效用有利于中等难度的提示,同时自然地重新审视不确定的提示。由此产生的程序能够适应政策漂移,并且不需要除标准政策训练之外的额外部署。数学、规划和几何推理基准以及多种强化学习算法的大量实验表明,KGPS 在强大的基线上持续提高了最终精度和轨迹采样效率,在在线提示选择方法中建立了最先进的性能。例如,在 DeepSeek-R1-Distill-7B 上,KGPS 的轨迹采样次数比 DS 少 83%,同时在六个数学推理基准测试中的平均性能甚至提高了 0.12 个百分点。