论文

通过分布对齐提示合成与反向提示退火缓解数学RLVR中的分布锐化

Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)能提升低$k$推理准确率,却在有挑战性的数学题上收窄解法覆盖面,且pass@1的提升并不必然转化为更好的大$k$表现。现有的基于提示(hint)的方法能让有挑战性的问题变得可训练,但有两个问题未被充分探索:师生分布不匹配,以及需要减少提示暴露以匹配无提示评估。我们通过两个组件解决这些问题。分布对齐提示合成(Distribution-Aligned Hint Synthesis, DAHS)以学生风格的响应为条件构建经核验的教师提示。反向提示退火(Backward Hint Annealing, BHA)跨难度分桶对提示暴露进行退火,并利用逐题提示丢弃(hint dropout)在整个RL训练过程中保留无提示更新。我们在DAPO训练框架下的数学RLVR中,使用$\texttt{Qwen3-1.7B-Base}$与$\texttt{Llama-3.2-1B-Instruct}$,在AIME24、AIME25和AIME26上评估该方法。在$\texttt{Qwen3-1.7B-Base}$上,相对于DAPO,我们的方法在三个AIME基准上同时提升了pass@1与pass@2048。在$\texttt{Llama-3.2-1B-Instruct}$上,增益集中在大$k$区间。这些结果表明,在数学RLVR中,提示脚手架在训练早期恢复了有挑战性问题上的可学习更新、并在无提示评估之前被逐步移除时才是有效的。

通过分布对齐提示合成与反向提示退火缓解数学RLVR中的分布锐化:论文配图
图 1:框架概述。 (上)给定问题 qq,基础学生模型会为教师模型生成样式模板。以 qq 和这些模板为条件,教师一次重复采样一个解决方案,DAHS 保留第一个经过验证的教师提示。 (下)在 RL 训练期间,提示丢失在问题级别进行:给定问题的 rollout 要么不接收提示,要么共享从教师提示派生的相同提示前缀。当 BHA 应用提示时,前缀构造根据特定于存储桶的提示比率 τb\tau_{b} 将完整的教师提示 h⁡(q)h(q) 截断为提示前缀 h~\tilde{h}。然后,验证器输出充当两个角色:它们定义参与者优势并提供用于退火提示的桶精度。参见第 2 节。 3.1 对于 DAHS 和 Sec。 3.2 对于 BHA。