论文
TELLME:用于丰富语言模型的测试增强学习
TELLME: Test-Enhanced Learning for Language Model Enrichment
摘要
连续预训练(CPT)已被广泛采用作为大语言模型中的域适应方法。然而,CPT始终伴随着挑战,例如获取大规模特定领域数据集的难度和计算成本较高。在这项研究中,我们提出了一种称为语言模型丰富测试增强学习(TELLME)的新方法来缓解这些问题。 TELLME 利用测试增强学习 (TEL) 原理,通过在训练期间使用测验来提高模型的训练效率。它将这一原则与 CPT 相结合,从而促进高效的特定领域知识获取和长期记忆保留。实验结果表明,TELLME 在金融领域的性能优于现有方法高达 23.6%,并且在长期记忆保留方面实现了 9.8% 的改进。