论文
LLM 百万笔记规模改写的综合临床笔记质量的系统评价
Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale
摘要
大语言模型 (LLM) 可以生成或合成适用于各种应用的临床文本,从改进临床文档到增强临床文本分析。然而,评估通常集中在一个狭窄的方面——例如相似性或效用比较——即使这些方面是互补的并且最好并行看待。在本研究中,我们的目标是对 LLM 生成的临床文本进行系统评估,其中包括对从 MIMIC 数据库改写的百万笔记规模的合成临床笔记的内在、外在和事实性评估。我们的分析表明,尽管语言发生了重大变化,合成笔记仍保留了粗粒度任务的核心临床信息和预测实用性,但丢失了 ICD 编码等任务的细粒度细节。我们表明,通过按块而不是整个笔记重新措辞,可以大大减轻这种细节的损失,但代价是在不完整的上下文下降低事实精度。通过事实核查和错误分析,我们进一步发现综合错误主要是对临床背景的误解,以及时间混乱、测量错误和捏造的主张。最后,我们表明,合成笔记尽管具有与任务无关的性质,但可以有效地增强对罕见 ICD 代码的特定任务训练。