论文
具有噪声 LLM 标签的鲁棒命名实体识别的错误类型感知损失重新加权
Error-Type-Aware Loss Reweighting for Robust Named Entity Recognition with Noisy LLM Labels
摘要
大语言模型 越来越多地用于注释数据集,以训练较小的任务专用模型,例如命名实体识别。虽然此方法产生有效的模型,但它假设合成数据集已正确注释。在这项工作中,我们发现(i)当前的 微调 过程简单地忽略 LLM 引入的注释噪声,导致性能下降;(ii)现有的抗噪声损失不能转移到序列标记,因为命名实体识别中的注释噪声是异构的:例如,缺失提及和类型错误以不同的方式影响训练信号。因此,在抗噪声损失中平等对待所有噪声词元并对所有词元应用单一重新加权标准可能会消除有用的监督或强化不正确的标签。为了解决这个限制,我们提出了 NER 的错误类型感知损失重新加权,它为不同类型的潜在错误词元引入了单独的重新加权规则。我们的方法简单高效,不需要额外的训练资源,并且在噪声水平在 15% 到 40% 之间的数据集水平平均值上将 F1 提高了 0.8 - 2.0 个百分点,在 Wikigold 上噪声水平为 24.1% 时最大提高了 4.6 个百分点。