论文

DECSELFMASK:通过自相关引导屏蔽利用未标记文本进行仅解码器分类

DECSELFMASK: Leveraging Unlabeled Text via Self-Relevance-Guided Masking for Decoder-Only Classification

模型训练预训练

摘要

分类任务需要带注释的数据,这些数据通常非常昂贵、耗时,甚至无法收集。医学领域就是这种情况,大型数据集通常很少有带注释的示例。为了解决这个问题,我们提出了 DecSelfMask(通过掩码进行解码器自学习),这是一种增强解码器在分类任务上的性能的方法。我们通过利用模型从未标记的数据创建训练示例,建立在常见的自学习方法的基础上,并提出了一种新颖的相关性引导屏蔽策略。我们使用相关性归因方法来确定未注释文本的哪些部分与任务相关。然后,我们通过屏蔽这些部分来创建自监督训练示例,训练模型通过下一个标记预测来重建它们。我们假设这些示例传达了有关未注释数据的结构和语义的知识,这对下游性能有用。我们在意大利一家医院收集的 190 万份临床记录中的 136 项任务上测试了我们的方法。我们在 5 个不同规模和系列的模型上量化了 DecSelfMask 对下游任务的影响,包括探测分析。实验显示出一致的增益,优于基本模型(Macro F1 中 +9.1 分)、持续预训练 (+6.3)、合成标签生成 (+12.5) 以及通用基线。结果表明,相关性归因可以作为解码器从未标记数据中学习的强大监督来源,超越现有方法。