论文

持续的 预训练 能否弥补医学领域通用语言模型和专用语言模型之间的性能差距?

Can Continual Pre-training Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?

模型训练预训练

摘要

本文通过持续的 预训练 和合并进行域适应,缩小了小型专用模型和更大的通用模型之间的性能差距。我们通过从 FineWeb2 构建高质量的德语医学语料库 (FineMed-de) 来解决专业非英语数据的稀缺问题。该语料库用于持续预训练和合并三个著名的 LLM(参数范围从 $7B$ 到 $24B$ 参数),创建 DeFineMed 模型系列。一项综合评估证实,专业化极大地提高了 $7B$ 模型在德国医疗基准上的性能。此外,基于 Qwen2.5 的模型的成对胜率分析表明,通过域适应,与更大的 Mistral-Small-24B-Instruct 相比,胜率增加了约 3.5 倍。该证据将专门的 $7B$ 模型定位为针对复杂的医疗指令遵循任务的有竞争力的、资源高效的解决方案。虽然模型合并成功恢复了指令跟踪能力,但随后的故障模式分析揭示了固有的权衡,包括引入语言混合和增加冗长性,强调了在未来工作中需要更有针对性的 微调。这项研究为开发专门的 LLM 提供了一种强大、合规的方法,作为在德语医疗保健环境中实际使用的基础。