论文

后训练 能否将 LLM 变成优秀的医疗编码器?生成式 ICD 编码的实证研究

Can Post-Training Turn LLMs into Good Medical Coders? An Empirical Study of Generative ICD Coding

模型训练强化学习

摘要

自动国际疾病分类 (ICD) 编码是计费、流行病学和临床决策支持的核心医疗编码任务。生成式 大语言模型 (LLM) 通常被报告为弱医学编码器,但这一发现主要来自推理时间设置,如提示、检索、重新排序或工具使用,从而导致特定任务 后训练 的作用尚未得到充分探索。我们提出了一项用于生成 ICD 编码的 后训练 的对照实证研究,比较了在通用协议和指标集下的提示、监督 微调 和强化学习中与 LLM 编码器的判别基线。据我们所知,这是第一项评估 ICD 编码中基于 RL 的 后训练 生成 LLM 编码器的研究。我们进一步引入 PHI,这是一种诊断课程,可扩展 GRPO 以完善漏码案例。我们的结果表明,仅提示评估大大低估了 LLM 对于 ICD 编码的潜力。 SFT 提供了主要的能力跳跃,GRPO 进一步改进了 SFT 之外的代码集预测,PHI 提供了宏观性能的目标增益。这些发现表明,主要瓶颈不仅仅是生成公式,而是如何调整和优化模型以实现全分类召回。我们在 https://github.com/AlexandreWANG915/LLM4ICD 发布了代码、数据分割和检查点。