论文
采用通用和生物医学 大语言模型 以及先进的快速工程进行药物流行病学研究设计
Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design
摘要
背景:大语言模型 (LLM) 自动化和支持药物流行病学研究设计的潜力是一个令人感兴趣的新兴领域,但其可靠性仍未得到充分表征。通用型 LLM 经常表现出不准确性,而专业生物医学 LLM 在该领域的比较性能仍然未知。方法:本研究使用 46 个协议(2018-2024 年)评估了通用 LLM(GPT-4o 和 DeepSeek-R1)与生物医学微调 LLM(QuantFactory/Bio-Medical-Llama-3-8B-GGUF 和 Irathernotsay/qwen2-1.5B-medical_qa-Finetune)的比较。 HMA-EMA 目录和哨兵系统。使用从最少到最多 (LTM) 和主动提示策略跨多个编码系统的相关性、论证逻辑和本体代码一致性来评估性能。结果:GPT-4o 和 DeepSeek-R1 与 LTM 提示配对,实现了最高的相关性和合理性得分逻辑,其中 GPT-4o-LTM 在 HMA-EMA 协议的 9 个问题中的 8 个问题中达到了 4 的中位相关性得分。生物医学 LLM 总体上表现出较低的相关性,并且经常产生不充分的理由。尽管 LTM 在推理稳定性方面提供了最一致的改进,但所有 LLM 在本体代码映射方面都表现出有限的熟练程度。结论:与生物医学 LLM 相比,现成的通用 LLM 目前为药物流行病学设计提供了更好的支持。提示策略强烈影响 LLM 性能。