论文
G-Loss:语言模型的图引导 微调
G-Loss: Graph-Guided Fine-Tuning of Language Models
摘要
用于 微调 预训练语言模型(例如 BERT)的传统损失函数,包括交叉熵、对比、三元组和监督对比损失,仅在局部邻域内运行,无法解释全局语义结构。我们提出了 G-Loss,一种图引导的损失函数,它结合了半监督标签传播来使用嵌入流形内的结构关系。 G-Loss 构建了一个文档相似性图来捕获全局语义关系,从而指导模型学习更具区分性和鲁棒性的嵌入。我们在涵盖关键下游分类任务的五个基准数据集上评估 G-Loss:MR(情感分析)、R8 和 R52(主题分类)、Ohsumed(医疗文档分类)和 20NG(新闻分类)。在大多数实验设置中,G-Loss 收敛速度更快,并产生语义一致的嵌入空间,从而比使用传统损失函数微调的模型具有更高的分类精度。