论文

医学转录的临床领域分类

Clinical Domain Classification from Medical Transcriptions

模型评测模型能力评测

摘要

临床领域分类在组织和分析大量非结构化医学文本中发挥着重要作用。然而,医学转录数据集通常高度不平衡,这会大大降低分类性能,特别是对于代表性不足的临床专业。在这项工作中,我们提出了对机器学习和基于Transformer的医学转录临床领域分类方法的比较研究。我们评估了六种传统的机器学习分类器——朴素贝叶斯、支持向量机 (SVM)、决策树、随机森林、K 最近邻 (KNN) 和 XGBoost——以及两种预训练的 Transformer 模型、BERT 和 XLNet,以及少量大型语言模型提示方法。实验对从 MTSamples 收集的医学转录数据进行,其中包括 40 个临床专业的 5,013 个样本。为了解决严重的类别不平衡问题,我们研究了两种平衡策略:使用基于 NLP 的同义词替换的文本增强和合成少数过采样技术 (SMOTE)。实验结果表明,数据平衡极大地提高了评估模型的分类性能。特别是,BERT 在 SMOTE 平衡数据集上实现了最高的 F1 分数 0.996,同时比 XLNet 需要更少的训练时间。结果强调了基于 Transformer 的表示与适当的数据平衡策略相结合用于临床领域分类的有效性,并为医学转录分析的经典机器学习、Transformer 模型和少样本提示提供了系统比较。