论文

MITE:多编程语言指令训练与实体投票抽取

Enhancing Biomedical Named Entity Recognition via Multiple Programming Languages Instruction Tuning and Ensemble Method

模型训练监督微调与指令调优

摘要

指令调优已成为将大型语言模型(LLM)应用于生物医学命名实体识别(BioNER)的常见范式,但面临两个关键挑战。首先,自然语言指令通常将标注序列化为扁平文本,为类型化实体抽取提供的结构约束有限。其次,高质量标注有限,单一输出形式可能限制结构多样性并降低鲁棒性;引入外部医学知识虽可缓解数据不足,却常需昂贵资源构建。为此,我们提出MITE,一种多编程语言指令调优与集成方法。MITE将BioNER改写为结构到结构生成,以代码形式表达指令和实体输出。每个训练实例在保持实体语义不变的情况下,转换成Python、C++和Java等多种格式,无需外部医学知识或额外标注即可提供结构多样的监督。推断时,以实体级投票聚合不同代码格式的预测,降低语言特定预测方差并改善鲁棒性。在六个广泛使用的BioNER数据集上,MITE持续优于代表性BERT与LLM基线,并表现出较强跨数据集泛化。消融与参数分析进一步验证各组件的有效性和鲁棒性。