论文

用于急诊科决策支持的本地可部署小语言模型:微调 策略的系统基准

Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

模型评测模型能力评测

摘要

在急诊科 (ED) 中部署 大语言模型 (LLM) 进行决策支持面临两大挑战:将患者数据传输到闭源商业 LLM 的隐私风险,以及缺乏对本地可部署开源小语言模型 (SLM) 的 微调 策略的系统评估。我们使用零样本提示、前缀调整、低秩适应 (LoRA) 和完整的 微调 对八个开源 SLM 在三个 ED 任务上进行了基准测试:分类级别预测、专家转诊推荐和诊断预测。使用 2,083 个 MIMIC-IV-ED 病例以及 Claude Haiku 4.5 和 Claude Sonnet 4.5 作为基线,我们发现 LoRA 微调的开源 SLM 在分类级别预测和专家转诊推荐方面优于商业基线,而诊断预测对于开源 SLM 仍然具有挑战性。混淆矩阵分析进一步表明,经过微调的开源 SLM 可以检测到商业基线遗漏的最严重的患者。这些结果表明,可本地部署的 SLM 可以在 ED 决策支持方面实现具有临床竞争力的性能。