论文
SciTBERT:一系列用于科技语言处理的按时间顺序一致的语言模型
SciTBERT: A family of chronologically consistent language models for scientific and technological language processing
摘要
预训练的Transformer模型越来越多地被用于研究科学技术进步。针对论文或专利文本进行调整的编码器在科学技术中的下游分类、回归和邻近任务方面优于通用模型。然而,由于这些预训练模型固有的前瞻和领域偏差,这些模型用于研究科学、技术及其接口的时间相关或档案属性的适用性受到限制。这些限制源于对具有不受约束的时间顺序和文本源分布的语料库的训练。我们介绍了 SciTBERT:一系列按时间顺序一致的 BERT 派生语言模型,使用来自科学论文、专利和高质量教育网络文本的文本进行训练,训练数据截止日期跨越 2013 年至 2025 年之间的每年。我们还使用论文和专利引用以按时间顺序一致的方式对这些模型进行后训练,创建 SciTBERT-CI 模型系列。我们发现这些模型通常优于前身的特定领域编码器模型,即使 训练数据受到语料库中早期限制的限制。为了进一步研究此类模型可以在多大程度上学习连接科学和技术的表示,我们引入了 PatRepEval 基准,这是一套在科学技术界面上与专利相关的文本嵌入任务。跨越论文和专利的各种分类、回归和检索任务的性能凸显了将编码器模型表示与其下游任务的域分布对齐的重要性,并且按时间顺序一致的编码器可以匹配或超过在没有时间限制的情况下训练的模型。