论文
探索用于生物医学数据到文本生成的小语言模型的 后训练 对齐:药物传单的案例研究
Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet
摘要
将复杂的生物医学数据转化为患者友好的叙述是现代生物医学信息学的核心。本研究对在专门的生物医学数据到文本生成任务中训练小语言模型 (SLM) 进行了比较分析。我们探索了广泛采用的 后训练 方法,包括监督 微调 (SFT)、直接偏好优化 (DPO)、优势比偏好优化 (ORPO) 和在药品包装传单数据集上使用基于 Qwen 的 SLM 的群体相对策略优化 (GRPO)。为了评估跨数据集的普遍性,我们还整理了来自 openFDA 的药物标签数据。我们使用标准词汇重叠指标(如 ROUGE)以及语义相似性指标来评估模型。在我们的实验中,结果表明:(1) 对齐的 SLM 优于 GPT-5 等专有模型; (2) ORPO 优于 SFT 基线; (3) 在测试的比对方法以及 GPT-5 中,GRPO 产生了最稳健的跨数据集性能。