论文

REALM:利用标注者专业水平对含噪标注进行可靠微调

REALM: Reliable Expertise-Aware Language Model Fine-Tuning from Noisy Annotations

模型训练监督微调与指令调优

摘要

大语言模型的监督微调依赖人工标注,但标注流程通常包含专业水平不同的众包标注者。常见做法用多数投票或简单平均汇总标签,丢弃标注者身份,使模型将不可靠标注者的错误吸收进参数。本文提出REALM,联合学习模型参数与每位标注者的标量专业水平;专业水平无需额外监督,仅需标注者身份。关键方法是将每个观测标签建模为模型预测与均匀随机猜测的混合,并由学得的标注者专业水平决定权重。REALM适用于具有固定标签集合的任务,也可通过学习专业水平矩阵扩展到多任务。在四个采用真实众包标注的文本分类数据集上,REALM在其中三个标注者水平不同的数据集的全部12种配置中表现最佳,相比最强适用基线、包括多数投票和Dawid–Skene聚合,平均提升2.9个百分点。在五个采用模拟含噪标签的问答基准上,它在162种配置中的152种优于直接使用噪声数据微调,平均提升5.0个百分点,收益随模型容量增加而增长。所学专业水平还可恢复标注者的可靠性,而无需事先观测可靠性标签。代码:https://github.com/sajjad-ucsb/REALM