论文

将科学论文展开为多轮生成轨迹以继续 预训练

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

模型训练合成数据

摘要

最近的一系列合成数据工作重建了现有文本背后的思维,而不是重写文本本身,但它对简短的网络段落进行操作,仅恢复局部思想,并且使整个文档的结构保持不变。科学论文的结构清晰且基本一致,为将这种范式提升到文档级别奠定了天然的基础。我们提出了一个管道,将每篇论文展开为多轮生成轨迹,其中教师模型重建整篇论文的写作过程:写作请求、全局计划和每个部分的预写审议。所有章节文本和摘要均逐字保留源论文。我们将该管道应用于 180 万篇经过质量过滤的 arXiv 论文,并获得了连续 预训练 (CPT) 的 60B 词元语料库,大约是源文本的两倍。相同的反向结构延伸到指令数据和评估。我们使用从论文文本中得出的答案构建了一个包含 20 万个样本的 SFT 数据集。我们还使用保留的论文构建 PAW-Bench,这是 2,940 项学术写作任务的基准,其中包含每个任务的评分标准和检查表。在对照实验中,对我们的语料库进行 CPT,然后对公共数据集进行 SFT,可以提高写作性能,同时保留一般推理并提高长文档阅读能力。用我们的合成指令数据替换部分写入 SFT 数据进一步提高了 PAW-Bench 上的性能。