论文

零样本精神病学数据的知识引导检索增强生成:隐私保护合成数据生成

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

模型训练合成数据

摘要

医疗保健研究中的人工智能系统已显示出提高患者吞吐量和帮助临床医生的潜力,但进展受到对真实患者数据的访问有限的限制。为了解决这个问题,我们提出了一个零样本、知识引导的精神科表格数据框架,其中 大语言模型 (LLM) 使用精神疾病诊断和统计手册 (DSM-5) 和国际疾病分类 (ICD-10) 通过检索增强生成进行引导。我们使用不同的知识库组合进行了实验,以生成保护隐私的合成数据。由此产生的模型与用于合成表格数据生成的两种最先进的深度学习模型(即 CTGAN 和 TVAE)进行了基准测试,这两种模型都依赖于真实数据,因此存在潜在的隐私风险。对六种与焦虑相关的疾病进行了评估:特定恐惧症、社交焦虑症、广场恐惧症、广泛性焦虑症、分离焦虑症和恐慌症。 CTGAN 通常实现了最佳的边际和多变量结构,而知识增强的 LLM 在配对结构上具有竞争力,并在分离焦虑和社交焦虑方面实现了最低的配对误差。消融研究表明,与无检索 LLM 相比,临床检索可靠地提高了单变量和成对保真度。隐私分析表明,与 CTGAN 相比,真正的无数据 LLM 产生适度的重叠和较低的平均链接风险,而 TVAE 尽管 k-map 得分较低,但仍表现出广泛的重复。总体而言,当真实数据集不可用或无法共享时,将 LLM 扎根于临床知识可以实现高质量、保护隐私的合成精神病学数据。