论文
阅读新闻:通过续 预训练 使 大语言模型 适应瑞典新闻业
Reading the News: Adapting Large Language Models to Swedish Journalism Through Continued Pre-Training
摘要
大语言模型 总体上能力越来越强,但在利基或未充分研究的领域其效用仍然有限。解决此限制的一种方法是通过对目标域语料库进行额外训练来专门化现有模型。在这项工作中,我们使用我们从数百万篇新闻文章中精选的高质量数据集,研究了这种持续的 预训练 以使 大语言模型 适应瑞典新闻业。为了评估适应效果,我们还构建了一个新颖的特定领域基准,涵盖六项编辑任务。通过跨两种模型大小的完整且参数高效的 微调,我们发现持续的 预训练 在目标领域中产生了好处,但只有在与经验回放结合使用时才能减轻遗忘。我们观察到模型的生成质量和事实知识持续增强,但没有观察到它们在判别任务中的熟练程度。通过探索 无需训练 方法来促进指令遵循,我们看到了进一步的改进,但专门针对低秩适应训练的模型。至关重要的是,我们证明了在适应过程中进行有针对性的评估的重要性,因为现有的瑞典基准在很大程度上无法捕获模型的域内性能增益。