论文
没有伤害吗?网络部署医疗中的幻觉和演员级滥用 大语言模型
Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models
摘要
医疗 大语言模型 (LLM),包括定制医疗 GPT (MedGPT) 和开源模型,越来越多地部署在网络平台上以提供临床指导。然而,它们带来了幻觉、不遵守政策和不安全设计的风险。我们对 6,233 个 MedGPT 进行了大规模评估,评估了 1,500 个分层样本以及 10 个开源 LLM。我们引入了两个框架:用于幻觉检测的 MedGPT-HEval 和用于评估策略违规和开发人员意图的基于 LLM 的管道。我们的结果表明,25-30% 的 MedGPT 事实准确性较低,底层和中层模型的风险最高; 33.6-54.3% 的模型违反了操作阈值,57.06% 的 Action 模型缺乏足够的隐私披露。与开源模型相比,MedGPT 实现了更高的事实准确性和语义对齐,但开源模型更稳定。这些结果揭示了幻觉和合规性方面的系统性差距,凸显了多指标评估和更强有力的保障措施的必要性。我们发布了 HAA-MedGPT,这是一个结构化数据集,支持面向网络的医疗 LLM 的安全性的未来研究。