论文

SAGE:语义锚引导的医学问答数据进化

SAGE: Semantic Anchor-Guided Evolution for Grounded Medical QA Data Synthesis

模型训练合成数据

摘要

为临床任务(例如医学问答 (QA))开发可靠的模型,受到高质量、专家标注的训练数据有限的严重限制。由于严格的隐私要求以及在资源有限的临床环境中使用大型开源语料库或专有云 API 的不切实际,加剧了这一挑战。为了解决这些障碍,我们引入了 SAGE(\textit{Semantic Anchor-Guided Evolution}),这是一种新颖的数据合成框架,可以使小型本地部署模型生成高质量的医学训练数据。 SAGE 利用轻量级、公开可用的分类法(例如 MeSH)作为语义锚,强加结构化先验以有效指导和奠定数据生成过程。 SAGE 的核心是迭代地交错原子(基于个体概念)和关联(基于关系)合成,从最小种子引导训练数据。这种方法消除了对大量医疗文档集合或对外部 API 的依赖,为本地数据创建提供了实用的解决方案。跨多个医疗问答基准的广泛实验表明,使用 SAGE 合成数据进行微调的模型始终优于使用自衍生或传统的基于文档范式训练的模型,突显了医疗 LLM 开发的数据效率和资源利用率的切实改进。代码可在 https://github.com/DIaacKr/SAGE. 获取

SAGE:语义锚引导的医学问答数据进化:论文原图
图 1:数据合成范例的比较。传统方法要么使用隐式参数知识导出数据,要么从文档语料库合成数据。相比之下,SAGE 通过语义锚合成高质量的医疗数据。