通过不匹配的错误草稿进行从弱到强的诱导
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
摘要
我们考虑来自较小、较弱模型的 离策略 经验是否可以激发出 同策略 RL 微调(例如 GRPO)无法达到的更强学习者的能力。我们发现,将来自较小但更多领域训练的模型(与当前问题不匹配)的数学上错误的草稿注入到更强的学习者的 GRPO 上下文中,在保留的 MATH-500 和分发外的 AIME 2025/2026 上始终优于标准 同策略 GRPO。具体来说,我们使用Mathstral-7B作为学习器,Qwen2.5-Math-1.5B作为草稿模型,8.8K Level 3--5 MATH问题(保留MATH-500),并与GRPO博士一起训练。不匹配是一个积极的成分:对不匹配问题的草稿进行洗牌,同时保持其他一切不变,在 MATH-500(贪婪通过@1)上,相对于匹配错误的变体($n=10$ 种子,$p=0.0015$,Welch 的 $t$),收益率为 $+1.62$pp。事实上,不匹配错误的变体领先于我们在 MATH-500 上测试的贪婪 pass@1 和采样 pass@$k$ 上的所有其他变体。在发行版外的 AIME 2025 和 2026 上,不匹配错误的变体独特地将 pass@$k$ 提升到 Mathstral-7B(以其原生 [INST] 格式)和 Qwen2.5-Math-1.5B 草稿模型之上,每个样本预算从 $k=1$ 到 $k=1024$ 跨越 2 个种子(2025 年为 $+14.2$pp,2025 年为 $+14.2$pp) $+9.0$pp 于 2026 年在 pass@1024 上超过 Mathstral-7B),并且在 pass@1024 上也导致了这两年的无草稿、匹配错误和不匹配正确的变体。所有变体都使用相同的提示,在测试时不注入草稿。该配方在没有 SFT、奖励模型、合成数据和生成-批评-修改内循环的单个 GPU 上进行训练,在 Mathstral-7B-v0.1 上达到了 71.98% MATH-500,这是据我们所知该模型已发布的最高结果,超过了较重的 WizardMath 管道,在完整 MATH(SFT + PPO 与过程/指令奖励模型)上达到 70.9%。