论文

CLiGNet:用于临床转录文本医学专科分类的临床标签交互图网络

CLiGNet: Clinical Label-Interaction Graph Network for Medical Specialty Classification from Clinical Transcriptions

模型架构混合架构

摘要

将临床转录文本自动分类到医学专科对分诊、编码和临床决策支持至关重要,然而在广泛使用的 MTSamples 基准上的已有工作存在严重数据泄漏,原因是在训练/测试集划分之前施加了 SMOTE 过采样。我们首先记录这一方法学缺陷,并在 40 个医学专科(4966 条记录)上建立无泄漏基准,揭示真实任务难度远高于此前报道的水平。随后我们提出 CLiGNet(Clinical Label Interaction Graph Network),该神经架构将 Bio ClinicalBERT 文本编码器与两层图卷积网络(GCN)结合,后者作用于由语义相似度和 ICD-10 章节先验构建的专科标签图。逐标签注意力门控融合文档表示与标签图表示,并用 focal 二元交叉熵损失训练以应对极端类别不平衡(181 比 1 的比例)。在从 TF-IDF 分类器到 Clinical Longformer 的七个基线中,未经校准的 CLiGNet 取得最高宏 F1 0.279,消融研究证实 GCN 标签图带来单一最大的组件增益(宏 F1 提升 0.066)。加入逐标签 Platt 缩放校准后期望校准误差为 0.007,体现了排序性能与概率可靠性之间的原则性权衡。我们提供全面的失败分析,涵盖成对专科混淆、稀有类别行为、文档长度效应和词元级 Integrated Gradients 归因,为临床 NLP 系统部署提供可操作的洞见。