论文
用于自动 ICD 编码的多模态双编码器检索
Multimodal Dual-Encoder Retrieval for Automated ICD Coding
摘要
准确的国际疾病分类 (ICD) 编码对于大规模临床研究、记录和计费至关重要。当前 ICD 预测方法存在三个主要问题:(1)它们无法理解多模式患者数据,因为它们依赖于结构化 EHR 数据或非结构化临床记录。 (2) 它们还难以扩展至大量 ICD 代码(ICD-9 中的 9K+ 代码),因为传统分类器需要密集的输出层,并且通常不能很好地泛化到长尾罕见疾病。 (3)临床使用缺乏透明度。为了应对这些挑战,本研究提出了一个两阶段框架,首先使用多模态双编码器检索模型检索 ICD 代码,其中通过门控融合集成结构化和非结构化患者数据。第二阶段使用基于LLM的重新排序器细化检索到的前 k 个候选者,该重新排序器提供排序代码和临床相关的解释。我们的实验表明,所提出的方法在多模态双融合分类器基线上改进了 Micro-F1 和精度。这些改进表明,将门控多模态检索系统与基于LLM的重新排序相结合是自动 ICD 编码的密集多标签分类的实用替代方案。
