论文

保真度、多样性和隐私:临床数据增强的多维 LLM 评估

Fidelity, Diversity, and Privacy: A Multi-Dimensional LLM Evaluation for Clinical Data Augmentation

模型评测评测方法与指标

摘要

高质量带注释的医疗数据(尤其是心理健康数据)的稀缺,给训练稳健的机器学习模型带来了重大瓶颈。隐私法规限制数据共享,使合成数据生成成为一种有前途的替代方案。在数据增强管道中使用 大语言模型 (LLM) 可以作为该领域的替代方案。在拟议的方法中,DeepSeek-R1、OpenBioLLM-Llama3 和 Qwen 3.5 用于生成以特定国际疾病分类第十修订版 (ICD-10) 代码为条件的综合心理健康评估报告。由于幼稚的文本生成可能导致模式崩溃或隐私泄露(记忆),因此引入了综合评估框架。生成的诊断文本从三个维度进行评估:语义保真度、词汇多样性和隐私/抄袭。结果表明,所有模型都可以生成临床连贯、多样化且隐私安全的综合报告,显着扩展了临床自然语言处理任务的可用训练数据,而不会损害患者的机密性。