论文
通过分布对齐提示合成与反向提示退火缓解数学RLVR中的分布锐化
Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing
摘要
可验证奖励强化学习(RLVR)能提升低$k$推理准确率,却在有挑战性的数学题上收窄解法覆盖面,且pass@1的提升并不必然转化为更好的大$k$表现。现有的基于提示(hint)的方法能让有挑战性的问题变得可训练,但有两个问题未被充分探索:师生分布不匹配,以及需要减少提示暴露以匹配无提示评估。我们通过两个组件解决这些问题。分布对齐提示合成(Distribution-Aligned Hint Synthesis, DAHS)以学生风格的响应为条件构建经核验的教师提示。反向提示退火(Backward Hint Annealing, BHA)跨难度分桶对提示暴露进行退火,并利用逐题提示丢弃(hint dropout)在整个RL训练过程中保留无提示更新。我们在DAPO训练框架下的数学RLVR中,使用$\texttt{Qwen3-1.7B-Base}$与$\texttt{Llama-3.2-1B-Instruct}$,在AIME24、AIME25和AIME26上评估该方法。在$\texttt{Qwen3-1.7B-Base}$上,相对于DAPO,我们的方法在三个AIME基准上同时提升了pass@1与pass@2048。在$\texttt{Llama-3.2-1B-Instruct}$上,增益集中在大$k$区间。这些结果表明,在数学RLVR中,提示脚手架在训练早期恢复了有挑战性问题上的可学习更新、并在无提示评估之前被逐步移除时才是有效的。
