论文

领域专用大语言模型回答精神科患者问题的表现

Performance of a domain-specific large language model in answering patient questions in psychiatry

模型评测模型能力评测

摘要

背景:本研究旨在评估一个仅用患者教育资源训练的领域专用大语言模型(LLM),能否以优于LLM聊天机器人的方式回答有关精神科药物的问题。我们开发了名为“MIND”的LLM,针对临床保真度微调,训练数据来自权威医疗组织的患者教育资源。方法:我们比较了MIND、ChatGPT和OpenEvidence对艾司西酞普兰患者问题的回答,采用两种方法:(1)依据测量准确性、清晰性、完整性、细致性、安全性和转诊适当性的评分表进行计算机分析;(2)由N=10名持照精神科医生按类似指标评分。结果:按评分表评分时,MIND在所有维度上得分最高(p<0.001)。由精神科医生评分时,ChatGPT被评为准确的次数多于MIND,但效应量可忽略(p=0.021,r=0.073);MIND被评为完整的次数多于ChatGPT,效应量较小(p<0.001,r=0.160);MIND与ChatGPT被评为安全的频率相同(p=0.955,r=0.002)。多数精神科医生更偏好ChatGPT生成的回答(57.6%),而非MIND(42.4%,p=0.003)。结论:MIND能够以精神科医生多数时候认定为准确、完整且安全的方式回答许多关于艾司西酞普兰的问题。然而,尽管MIND能提供更完整的回答,精神科医生仍更偏好ChatGPT的回答。MIND代表了构建安全LLM系统以促进精神科患者教育的一步。