论文

优化 大语言模型 以进行药物警戒中的因果关系评估:开发性能指标作为贝叶斯超参数优化的目标

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

模型评测评测方法与指标

摘要

背景:个案安全报告 (ICSR) 数量的不断增长增加了对可扩展的自动化因果关系评估的需求。 大语言模型 (LLM) 表现出了希望,但临床要求较高的任务的性能仍然不理想,并且推理时间超参数优化尚未得到研究。目标:开发与高斯过程 (GP) 兼容的优化目标,并研究温度优化是否改善了 FAERS ICSR 的 Naranjo 因果关系评估的 LLM 专家协议。方法:对 723 例分层 FA​​ERS 病例进行专家因果关系评估。 OpenAI 的 GPT-5.2 使用思想链 (CoT) 提示进行评估。开发了四种复合指标:加权余弦相似度 (WCS)、信息加权一致性得分 (IWAS)、熵权加权一致性和余弦相似度得分 (EWACS) 以及共识加权余弦相似度 (CWCS),并使用 GP 代理和改进概率 (PoI) 采集的贝叶斯优化应用于不同温度 [0, 2]。结果:GPT-5.2 在基线 (T = 0) 上优于先前的生物医学 LLM,在 Naranjo 算法的问题 5 上达到 74.1% 的一致性,在问题 10 上达到 65.4% 的一致性。熵分析将这些确定为唯一的信息优化目标。温度没有显示出系统的群体水平影响(\b{eta} = 0.002,p = 0.959)。 EWACS 引导的贝叶斯优化将因果关系分类一致性从 45.0% 提高到 72.0% (+27 pp),其中可疑案例的增幅最大 (+42.9 pp)。结论:EWACS 被确定为最佳的 GP 兼容指标。缺乏通用温度最佳值表明 LLM 性能主要由 ICSR 含量驱动,但特定情况的温度选择产生了有意义的改进,支持 LLM 辅助药物警戒的温度优化。