论文

BioBigBird:生物医学文本中长距离依赖性处理的稀疏注意力模型

BioBigBird: A Sparse Attention Model for Long-Range Dependency Processing in Biomedical Text

模型训练模型架构Transformer预训练

摘要

虽然特定领域的大型语言模型 (LLM) 编码了大量的生物医学知识,但其有限的上下文窗口往往阻碍了对文本内部和文本之间微妙关系的深入理解。为了解决这一限制,我们引入了 BioBigBird,这是一种根据大量生物医学文献和临床数据进行预训练的双向语言模型,专门用于处理远程依赖性。 BioBigBird 利用稀疏注意力机制来处理多达 4096 个标记的序列,其训练采用多阶段过程来减轻大规模预训练语料库中的噪声。我们通过采用多任务学习(MTL)框架进一步增强其性能,该框架联合优化命名实体识别和关系提取。对 BLURB 基准的综合评估表明,我们的 MTL 增强型 BioBigBird 与最先进的模型相比取得了极具竞争力的结果。我们的工作为专门领域开发强大的长上下文语言模型提供了一种有效的方法,展示了扩展的价值 用于复杂文本分析的序列处理。我们的模型可在https://huggingface.co/collections/bisectgroup/biobigbird. 公开获取