论文
综合重写作为质量倍增器:来自葡萄牙语持续预训练的证据
Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining
摘要
通过文档重写生成合成数据已成为一种有前途的改进语言模型预训练的技术,但大多数研究都集中在英语上,并且没有系统地控制重写源数据的质量。我们提出了一项对照研究,研究在葡萄牙语持续预训练的背景下,合成重写如何与源数据质量相互作用。从 ClassiCC-PT(一个用 STEM 和教育质量分数注释的葡萄牙语语料库)开始,我们构建了两个不同质量级别的 10B 词元子集,并使用 7B 指令调整模型将每个子集重写为四种样式,每个条件生成大约 40B 词元的合成数据。我们在每种条件下训练两个以英语为中心的基本模型(1.1B 和 7B 参数),并在 PoETa V2(一个全面的 44 任务葡萄牙语基准)上进行评估。在 7B 规模上,重写高质量数据比未修改的相同数据产生 +3.4 NPM 增益,而重写低质量数据仅提供 +0.5 NPM。在 1.1B 尺度上,这种交互作用较弱,未修改的低质量数据的性能与重写的高质量数据相当。我们的结果表明,综合重写主要充当质量乘数而不是数据管理的替代品,并且这种效果与规模相关。