论文

医学 LLM 适应的权衡:法国 QA 的实证研究

Trade-offs in Medical LLM Adaptation: An Empirical Study in French QA

模型评测模型能力评测

摘要

大语言模型(LLM)的发展导致人们越来越关注它们对专门领域和语言的适应,但领域适应策略的有效性仍不清楚。我们以法国医学问答(QA)作为案例研究,提出了一项医学领域适应研究。我们比较了连续预训练 (CPT)、有监督的 微调 (SFT) 以及它们在三个模型系列、多种尺寸和三种初始化类型中的组合,明确地将适应效果与基础模型选择分开。我们使用自动指标和 LLM-as-a-Judge 评估在贪婪和约束解码下评估多项选择 (MCQA) 和开放式 QA (OEQA)。对于 MCQA,CPT+SFT 通常会获得最佳分数,但相对于 SFT 的收益很小,而且通常不具有统计显着性,这使得 SFT 成为强大且具有成本效益的默认设置。对于 OEQA,CPT 持续改进基于重叠的指标,而 SFT 经常降低生成质量;基于 LLM 的评估首选指令调整和 CPT+SFT。跨语言实验进一步表明从法语改编到英语基准的有效转移。总的来说,我们为在计算限制下选择适应策略提供了实用指南。