论文

使用更好的标记更快地学习:用于专业文本摘要的参数高效词汇适应

Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization

模型训练参数高效训练

摘要

在通用领域语料库上进行预训练的 大语言模型 在应用于专业领域时通常会表现出标记化效率低下的情况。尽管针对领域适应的持续预训练部分缓解了性能下降,但它并不能解决基本的词汇不匹配问题。为了解决这一差距,我们引入了一种有针对性的参数高效域适应方法,该方法将词汇适应与基于 LLM 的文本摘要的预训练相结合。我们的统一框架使用特定于域的词元增强了预训练的词元生成器,同时有选择地替换训练不足和无法访问的词元以限制参数增长。我们在以挑战为导向的评估协议上跨法律和医学摘要任务评估我们在 Llama-3.1-8B 和 Qwen2.5-7B 上的方法,该协议侧重于专家驱动的文本和摘要,这些文本和摘要通常具有较高浓度的过度分散的词汇外 (OOV) 单词。词汇适应算法通过提高生成的摘要与其参考文献之间的语义相似性来提高摘要模型的整体质量。此外,改编后的模型生成的摘要包含了更合适的新颖和特定领域的单词,从而提高了连贯性、相关性和 忠实性。我们进一步观察到,我们提出的方法与连续预训练相比,显着减少了训练时间 $35-55\%$,并且相对于仅扩展方法,参数计数最多减少了 $37\%$。我们在 https://github.com/gb-kgp/VocabReplace-Then-Expand 上公开提供代码库。