论文
AdaKP:面向推理导向强化学习的在线自适应知识点选择
AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning
摘要
可验证奖励强化学习是引出大语言模型推理能力的强大范式,但在竞赛级数学上存在严重的奖励稀疏问题。一种常见补救措施是将原子知识点(KP)——从标准答案中蒸馏出的简短自然语言提示——注入提示词。然而,现有方法要么离线一次性固定这一选择,要么只是扩大注入文本的整体数量,而未触及选择中最具信息量的维度:注入哪些原子KP子集,以及何时注入。我们提出AdaKP,一个在RL训练过程中为每道题重新选择KP子集的在线选择器。其核心是一个熵代理,通过某个KP所引起的下一token熵下降来为其评分——只需一次低廉的前向传播,且其截断偏差具有可证明的界——以此替代昂贵的基于回放的估计。三种轻量机制使该信号可在线使用:吸收每步噪声的动量平滑器、在保留探索的同时剪除弱KP的退休-复活管理器,以及将重新评估前置到训练早期的自适应调度器。AdaKP还贡献了一个预检验证门,在任何昂贵运行启动之前,以留一法真值对代理进行认证,从而将方法层面的风险转化为可证伪的检查。AdaKP实现为标准DAPO+GRPO训练器的完全增量式分支,不改变优化器,在全部八个竞赛数学基准上以可忽略的额外成本超越强静态选择基线,将经过验证的在线KP子集选择确立为推理导向强化学习中一个实用且尚未充分探索的维度。