论文

Golden Goose:从不可验证互联网文本合成无限RLVR任务的简单技巧

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

模型训练强化学习合成数据RLVR

摘要

可验证奖励强化学习(RLVR)已成为解锁大语言模型(LLM)复杂推理的基石。然而,RL的扩展受限于现有可验证数据的匮乏,长时间训练下改进日益饱和。为克服这一点,我们提出Golden Goose,一个从不可验证互联网文本合成无限RLVR任务的简单技巧:构造填空(fill-in-the-middle)任务的多选题版本。给定源文本,我们提示LLM识别并掩蔽关键推理步骤,然后生成一组多样、合理的干扰项。这使我们能够利用通常被先前RLVR数据构建排除的推理丰富但不可验证的语料(如科学教科书),合成GooseReason-0.7M——一个包含超过70万个任务、横跨数学、编程与通用科学领域的大规模RLVR数据集。实证上,GooseReason有效复活了在现有RLVR数据上饱和的模型,在持续RL下带来稳健、持续的增益,并在15个多样基准上为1.5B与4B-Instruct模型取得新的最先进结果。最后,我们在真实场景部署Golden Goose,从原始FineWeb抓取数据为网络安全领域合成RLVR任务——该领域此前不存在RLVR数据。用所得数据GooseReason-Cyber训练Qwen3-4B-Instruct创下网络安全新最先进水平,超越一个经大量领域专项预训练与后训练的7B领域专用模型。这凸显了利用丰富、推理丰富、不可验证的互联网文本自动扩展RLVR数据的潜力。

Golden Goose:从不可验证互联网文本合成无限RLVR任务的简单技巧
图1:olden oose 流水线。我们通过构建 fill-in-the-middle 任务的 MCQ 版本,从不可验证文本合成 RLVR 任务。给定一段源文本,我们提示 LLM 先识别一段连续的关键推理步骤并用 [MASK] 替换它,将被移除的内容视为 ground-truth 答案,然后生成一组多样化、貌似合理且与被掩盖片段相似但不正确的干扰项。对于噪声较大的数据源(例如网页抓取),我们提示 LLM 先提取一段具有教育价值的文本,再基于它构建 MCQ。我们进一步应用基于难度的过滤以移除简单问题。