论文
eCREAM-MedCorpus 意大利语临床笔记大型语料库
eCREAM-MedCorpus A Large-Scale Corpus of Clinical Notes for Italian
摘要
我们推出了 eCREAM-MedCorpus,这是意大利医院急诊科生成的全新且独特的大规模临床记录数据集。该语料库当前版本由大约 400 万条完全匿名的临床记录组成,涵盖了急诊科患者护理期间的不同阶段。此外,临床专家通过结构化病例报告表 (CRF) 手动注释了约 6000 条注释,其中包含 132 条与急诊科两种患者情况(呼吸困难和意识丧失)相关的项目。项目可以采用数值(例如,血液饱和度)、分类值(例如,意识水平)、二元值(例如,是否存在创伤)和混合值类型。注释过程涉及多名临床医生,并进行了迭代修订,以解决项目表述中的歧义,从而产生了结构丰富(尽管高度不平衡)的资源。该数据集旨在填补能够支持 大语言模型 在具体医疗应用中的开发和使用的相关数据空白。我们描述了数据收集协议、现场匿名化管道、语料库统计和注释方案。最后,我们提出 CRF 填充作为一种新颖的结构化信息提取基准,并提供由 Gemma-27B 和 MedGemma-27B 产生的零样本基线。据我们所知,eCREAM-MedCorpus 是现有的最大的意大利语临床笔记免费数据集。