论文
自动临床编码中的分解错误和风格
Decomposing Error and Style in Automated Clinical Coding
摘要
在自动化临床编码中,标签空间跨越数万个诊断和程序代码,目前根据单个黄金注释来评估模型,将任何偏差视为错误。但我们发现,当两个团队对相同的 110 个 ACI-Bench 遭遇进行编码时,他们对同一个音符只有 73% 的代码(Jaccard 相似度)达成一致;即使在独立临床审核消除了错误代码之后,一致性也仅上升至 77%。这个差距是错误还是系统性的?我们将系统组件建模为编码风格 $\psi$,即编码器或站点特定的关于编码内容和记录数量的策略,并将编码重新编码为 $p(\mathrm{code}\mid\mathrm{note},\psi)$,用 10 维标题估计 $\psi$。如果风格是噪音,那么对其进行调节就毫无作用。相反,在五个数据集中,以数据匹配风格为条件的模型将 ICD F1 提高了最多 26 个点,而极端不匹配的模型将其降低了最多 21 个点。一旦提供了风格,涵盖 39-49 F1 的四种基于提示的编码方法就会收敛到 52-56(所有 p<0.05)。单金评估对建模错误的大部分指控是可恢复的、未建模的风格。