论文

KnowRL:通过最小充分知识引导的强化学习提升LLM推理能力

KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance

模型训练强化学习RLVR

摘要

RLVR能提升大语言模型的推理能力,但其效果常常受限于困难问题上严重的奖励稀疏性。近期的基于提示(hint)的RL方法通过注入部分解答或抽象模板来缓解稀疏性,但它们通常靠增加更多token来扩展引导量,这会引入冗余、不一致和额外训练开销。我们提出KnowRL(知识引导强化学习),一个将提示设计视为最小充分引导问题的RL训练框架。在RL训练过程中,KnowRL将引导分解为原子知识点(KP),并使用约束子集搜索(CSS)构建紧凑且感知交互作用的训练子集。我们进一步发现了剪枝交互悖论——移除单个KP可能有帮助,而同时移除多个此类KP却可能有害——并在这种依赖结构下显式优化鲁棒的子集筛选。我们从OpenMath-Nemotron-1.5B训练出KnowRL-Nemotron-1.5B。在1.5B规模的八个推理基准上,KnowRL-Nemotron-1.5B持续优于强大的RL与提示基线。在推理时不使用KP提示的情况下,KnowRL-Nemotron-1.5B达到70.08的平均准确率,已比Nemotron-1.5B高出+9.63分;配合精选KP,性能进一步提升至74.16,在该规模上确立了新的最优水平。模型、精选训练数据与代码已公开于 https://github.com/Hasuer/KnowRL。

KnowRL:通过最小充分知识引导的强化学习提升LLM推理能力:论文配图
(a) 关键片段效应。(b) 交叉提示不一致。(c) 指导效率权衡。图 1:基于提示的 RL 的三个关键挑战。 (a) 关键段效应:一旦出现短的关键提示段,性能就会急剧提高,超过该段后收益递减。 (b) 交叉提示不一致:较长的前缀或抽象可能会引入分支或歧义,从而扩大推理搜索空间。 (c)指导效率权衡:基于抽象的提示通常依赖于教师模型或多阶段管理,增加了计算开销。