论文
RLVR策略坍缩与Mesh Learning
All Work And No Play Makes Jack a Dull Boy: Understanding and Preventing Catastrophic Strategy Collapse in RLVR
摘要
在用可验证奖励的强化学习(RLVR)对大语言模型做后训练时,GRPO式算法可能出现严重的后期坍缩。基于提示的探测表明这不是良性的策略剪枝,而是有效策略容量的有害收缩——使不同的推理策略日益不可及。我们通过轨迹级策略更新交互定义策略,并建立结合优化动力学与信息论的统一理论框架。我们证明主要RLVR目标会逐步把概率质量集中到单一策略上,而维持非平凡任务准确率需要最小策略容量。两个结果的冲突为灾难性坍缩提供了机制解释。我们进一步推导镜像纠缠指数(MEI)作为轻量在线预警信号。为防止坍缩,我们提出Mesh Learning,它暴露多个推理策略并防止任何单一策略支配优化。在AIME26、AIME25、MATH-500、GPQA与LiveCodeBench上,Mesh Learning在Qwen与Phi模型族上一致优于强基线,分别最高提升13.4与11.5个百分点。这些结果把策略保持确立为稳定RLVR的关键原则。项目页:https://github.com/Ayanami-0123/Open-Mesh-Learning。