论文
综合混合训练:扩展 RAG 之外的参数化知识获取
Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG
摘要
合成数据增强有助于语言模型学习数据受限领域的新知识。然而,通过训练更多的合成词元或使用更强的生成器来简单地扩展现有的合成数据方法,会产生低于 RAG 性能的收益递减。为了打破 RAG 上限,我们引入了综合混合训练,它结合了综合 QA 和综合文档。这利用了它们的互补训练信号,并随着合成数据量和生成器强度的增加而实现对数线性改进。这使得该模型在长文档阅读理解基准 QuaLITY 上的表现比 RAG 提高了 2.6%。此外,我们还引入了焦点重写(Focal Rewriting),这是一种用于合成文档生成的简单技术,它明确地根据特定问题生成文档,提高了合成文档的多样性并产生更陡峭的对数线性缩放曲线。在 QuaLITY 上,我们的最终配方训练了 Llama 8B 模型,其性能相对优于 RAG 4.4%。在模型和基准(QuaLITY、LongHealth、FinanceBench)中,我们的训练使模型能够在六种设置中的五种中击败 RAG,表现优于 RAG 2.6%,并在与 RAG 结合时实现 9.1% 的增益。