论文
WRAP++:网络发现放大预训练
WRAP++: Web discoveRy Amplified Pretraining
摘要
合成数据重写已成为增强 大语言模型 (LLM) 预训练期间知识获取的强大技术。然而,现有方法在单文档级别运行,单独重写各个网页。这将合成的示例限制为文档内知识,缺少跨文档关系,并使事实具有有限的关联上下文。我们提出了 WRAP++(Web discoveRy Amplified Pretraining),它通过从 Web 超链接发现跨文档关系并对每个发现的文档对综合联合 QA 来放大事实知识的关联上下文。具体来说,WRAP++ 发现高置信度的关系主题,包括双链接和共同提及,并综合需要跨两个文档进行推理的 QA。这会产生单独的源文档中不存在的关系知识,从而为同一事实创建不同的入口点。由于有效实体对的数量以组合方式增长,因此这种发现驱动的合成也扩大了数据规模,远远超出了单文档重写的范围。在维基百科上实例化 WRAP++,我们将原始文本的约 8.4B 标记放大为跨文档 QA 数据的 80B 标记。在 SimpleQA 上,使用 WRAP++ 训练的 7B 和 32B 规模的基于 OLMo 的模型明显优于单文档方法,并表现出持续的缩放增益,强调了跨文档知识发现和放大的优势。