论文
超越基础:利用 大语言模型 进行细粒度医疗实体识别
Beyond the Basics: Leveraging Large Language Model for Fine-Grained Medical Entity Recognition
摘要
从入院笔记、出院小结和急诊病史等非结构化医疗叙述中提取临床相关信息仍然是临床自然语言处理 (NLP) 中的一个挑战。医疗实体识别 (MER) 识别这些记录中嵌入的有意义的概念。 大语言模型 (LLM) 的最新进展显示出具有竞争力的 MER 性能;然而,评估通常侧重于一般实体类型,对需要更细粒度提取的现实临床需求提供的效用有限。为了弥补这一差距,我们严格评估了开源 LLaMA3 模型,以实现 18 个临床详细类别的细粒度医疗实体识别。为了优化性能,我们采用了三种学习范式:零样本、少样本和具有低秩适应 (LoRA) 的 微调。为了进一步增强小样本学习,我们利用预训练的 BioBERT 模型引入了两种基于标记和句子级嵌入相似性的示例选择方法。与之前在专有模型(例如 GPT-4)或 微调 不同架构上评估零样本和少样本性能的工作不同,我们通过将所有策略应用于统一的 LLaMA3 主干来确保方法的一致性,从而实现跨学习设置的公平比较。我们的结果表明,微调后的 LLaMA3 分别超越零样本和少样本方法 63.11% 和 35.63%,在颗粒医学实体提取中实现了 81.24% 的 F1 分数。