论文
用于生物医学声明验证的小型 LLM:具有成本效益的 微调、结构数据集快捷方式和跨域泛化
Small LLMs for Biomedical Claim Verification: Cost-Effective Fine-Tuning, Structural Dataset Shortcuts, and Cross-Domain Generalization
摘要
GPT-4o 和 GPT-5 等 大语言模型 在生物医学声明验证上实现了强大的零样本性能,但成本和不透明度限制了可扩展使用。我们通过 SciFact 和 HealthVer 上的 QLoRA 微调了三个小型 LLM:Phi-3-mini (3.8B)、Qwen2.5-3B 和 Mistral-7B,提供了针对 GPT-4o 和微调 BioLinkBERT 编码器的 QLoRA 模型的首次研究。 Mistral-7B QLoRA 仅使用 1,008 个训练示例,以极低的成本超越了 GPT-4o 和 GPT-5(F1 增益高达 12%)。我们进行广泛的域内和跨域评估:在 SciFact 上训练的模型在 HealthVer 上进行测试,反之亦然,以匹配的大小将数据集结构与数据量隔离。我们在 SciFact 中发现了一个先前未报告的结构工件,该工件夸大了域内分数,并通过双向域外评估表明,对结构合理的数据进行训练可以实现稳健的跨域传输。我们计划发布所有代码和适配器检查点。