论文

LLM 生成的临床语料库中有多少实际上是新的?用于出处分类的内容冗余的生产规模测量

How much of an LLM-generated clinical corpus is actually new? A production-scale measurement of content redundancy for provenance classification

模型训练合成数据

摘要

临床机器学习越来越依赖于 大语言模型 (LLM) 生成的训练语料库,而不是由临床医生注释,并且此类语料库主要根据其报告的规模进行描述和重用。我们测试交易量是否反映了信息内容。分析应用于 167,034 名患者叙述的多智能体临床提取管道的完整输出,在 11 通道管道的 10 个文本承载通道中生成 25.1 亿个词元,我们引入了基于来源的冗余分解,这是按源对整个输出进行的 词元级 分类。只有 10.9% 的输出是可训练的独特内容,而 79.4% 是冗余的;原始词元计数将信息内容夸大了大约九倍。冗余是通过两种不同的机制产生的,将源上下文逐字复制到每个项目字段中,以及跨记录复制生成的文本,其中只有前者可以无损删除。基于无损压缩的独立、无模型分析确认了冗余,在不参考来源标签的情况下恢复了两种机制。一个管道通道几乎不携带冗余,这表明冗余级别取决于每个通道的结构方式,而不是 LLM 提取的固定属性。由于未纠正的冗余增加了生成最多项目的较长、较复杂的演示文稿的权重,因此它会扭曲语料库的 词元级 训练分布(我们直接测量的属性)。在受控的下游测试中,在适应之前对语料库进行重复数据删除改进了外部疾病识别基准的临床编码器,在相同的 词元预算 上,在适应深度上稳健,并在第二个基准上复制,确认冗余带来了超出存储的可测量成本。分类工具已公开发布。