论文
KnowRL:通过最小充分知识引导的强化学习提升LLM推理能力
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
摘要
RLVR能提升大语言模型的推理能力,但其效果常常受限于困难问题上严重的奖励稀疏性。近期的基于提示(hint)的RL方法通过注入部分解答或抽象模板来缓解稀疏性,但它们通常靠增加更多token来扩展引导量,这会引入冗余、不一致和额外训练开销。我们提出KnowRL(知识引导强化学习),一个将提示设计视为最小充分引导问题的RL训练框架。在RL训练过程中,KnowRL将引导分解为原子知识点(KP),并使用约束子集搜索(CSS)构建紧凑且感知交互作用的训练子集。我们进一步发现了剪枝交互悖论——移除单个KP可能有帮助,而同时移除多个此类KP却可能有害——并在这种依赖结构下显式优化鲁棒的子集筛选。我们从OpenMath-Nemotron-1.5B训练出KnowRL-Nemotron-1.5B。在1.5B规模的八个推理基准上,KnowRL-Nemotron-1.5B持续优于强大的RL与提示基线。在推理时不使用KP提示的情况下,KnowRL-Nemotron-1.5B达到70.08的平均准确率,已比Nemotron-1.5B高出+9.63分;配合精选KP,性能进一步提升至74.16,在该规模上确立了新的最优水平。模型、精选训练数据与代码已公开于 https://github.com/Hasuer/KnowRL。
