检索,然后分类:临床价值集创作的基于语料库的自动化
Retrieve, Then Classify: Corpus-Grounded Automation of Clinical Value Set Authoring
摘要
临床值集创作——识别定义临床概念的标准化词汇中的所有代码的任务——是临床质量测量和表型分析中反复出现的瓶颈。一种自然的方法是提示 大语言模型 (LLM) 直接生成所需的代码,但结构化临床词汇量很大,受版本控制,并且在预训练期间不能可靠地记忆。我们提出检索增强集完成(RASC):从精选语料库中检索 $K$ 个最相似的现有值集以形成候选池,然后将分类器应用于每个候选代码。理论上,检索和选择可以通过将有效输出空间从完整词汇表缩小到更小的检索候选池来降低统计复杂性。我们在 11,803 个公开可用的 VSAC 值集上展示了 RASC 的实用性,为该任务构建了第一个大规模基准。在 SAPBert 上微调的交叉编码器实现了 AUROC~0.852 和值集级别 F1~0.298,优于更简单的三层多层感知器(AUROC~0.799、F1~0.250),并且两者都将每个真阳性的不相关候选者数量从 12.3(仅检索)分别减少到大约 3.2 和 4.4。零样本 GPT-4o 实现了值集级别 F1~0.105,其中 48.6\% 的返回代码完全不存在于 VSAC 中。这种性能差距随着值集大小的增加而扩大,这与 RASC 的理论优势一致。我们观察到其他两种分类器模型类型(即从预训练的 SAPBert 初始化的交叉编码器和 LightGBM 模型)中也有类似的性能提升,这表明 RASC 的优势超出了单个模型类的范围。下载和创建基准数据集的代码以及 模型训练 代码位于:\href{https://github.com/mukhes3/RASC}{https://github.com/mukhes3/RASC}。