论文

超越改写:书籍级组织改进用于mid-training的合成教科书数据

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

模型训练合成数据

摘要

合成教科书数据已提升了语言模型预训练效果,但既往工作大多将这一收益视为生成内容本身或局部改写风格的属性。我们研究另一个因素:相关内容是否被组织成连贯的书籍级文档。我们同时贡献了一条可扩展的合成流水线以及证明这种组织方式确实重要的受控证据。该流水线从预训练语料中检索源材料,将其聚类为主题单元,规划层次化目录,并把基于源文本的章节组装成完整书籍(即我们的 Full 设置),共生成跨 15,000 多个学科的 68.6 万本教科书(320 亿 token)。在 mid-training 混合数据中用该语料替换自然书籍,可使下游性能平均提升 +1.09。随后通过受控比较厘清各相关设计因素。内容匹配的 Split 条件保持生成文本与 token 数不变,但将每个章节视为独立文档;Full 的 +1.02 平均增益分离出文档打包方式的作用。长度匹配、将不同书籍章节拼接在一起的 RandomConcat 对照仍低于 Full,排除了单纯文档长度的影响。检索池匹配的 Rephrase 条件在相同的受众—风格方案下独立改写各检索文档,但不做聚类、目录规划或书籍组装;Full 的 +1.17 增益证明了结构化合成的价值。在 Llama3-8B 上,Full 同样优于 RandomConcat 和自然书籍,支持将书籍级组织作为合成预训练数据设计的一个有效维度。

超越改写:书籍级组织改进用于mid-training的合成教科书数据:论文配图
图 2:训练条件。 Split 保留生成的文本和固定的标记; RandomConcat 使用不同书籍中的部分来匹配 Full 的文档长度; Rephrase独立地重写来自同一检索池的文档; Natural Books 是原创混合参考书。