论文

软件工程文本中的 预训练:对领域适应和通用语言理解的影响

Pre-Training on Software Engineering Texts: Effects on Domain Adaptation and General-Language Understanding

模型训练预训练

摘要

通才和以代码为中心的语言模型 (LM) 越来越多地应用于软件工程 (SE),但它们是否针对理解 SE 文本工件(例如问题、提交消息、开发人员讨论)进行了优化仍不清楚,因为大多数证据来自以代码为中心的基准测试。我们研究如何使编码器和解码器 LM 适应 SE 文本,在新的 SE 语料库上将连续 预训练 (CPT) 与从头开始的 预训练 (PTS) 进行比较,并评估领域适应 (SELU) 和通用语言理解 (SuperGLUE)。为了保持比较公平,我们在恒定词元和计算匹配预算下控制 预训练。我们发现,在不同的家族和规模中,重用现有的 LM 主导着从头开始训练领域原生的 LM:CPT 产生的领域收益很小且大多是不确定的,同时通用语言理解基本不变,而 PTS 在两个轴上都付出了巨大且通常是决定性的惩罚,并且只有在词元丰富的预算下才对小型 LM 具有竞争力。我们将这些结果提炼成使 LM 适应 SE 文本的实用指南,并在我们的复制套件中发布我们的语料库和预训练的 LM。