论文

为荷兰医学对话生成高质量的综合数据

Generating High Quality Synthetic Data for Dutch Medical Conversations

模型训练合成数据

摘要

医疗对话提供了对电子健康记录中通常缺乏的临床沟通的见解。然而,开发可靠的临床自然语言处理(NLP)模型受到特定领域数据集稀缺的阻碍,因为由于隐私和道德限制,临床数据通常无法访问。为了应对这些挑战,我们提出了一个使用荷兰语微调 大语言模型 生成综合荷兰语医学对话的管道,并以真实的医学对话作为语言和结构参考。生成的对话由母语人士和医生通过定量指标和定性审查进行评估。定量分析显示,词汇多样性很强,轮流过于规律,表明对话流程是照本宣科的,而不是自然的。定性审查的得分略低于平均水平,评估者注意到领域特异性和自然表达方面的问题。定量和定性结果之间的有限相关性凸显出仅靠数字指标无法完全捕捉语言质量。我们的研究结果表明,生成综合荷兰语医学对话是可行的,但需要领域知识和精心构建的提示来平衡对话的自然性和结构。这项工作为通过合乎道德的合成数据扩展荷兰临床 NLP 资源奠定了基础。