论文
判断与敏感性:以医生专家为参照评测大语言模型的临床分诊建议
Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts
摘要
随着大语言模型(LLM)越来越多地用于临床场景,评估其在真实临床文本变化下的可靠性至关重要。我们在临床分诊中研究这一问题,将大语言模型与执业医生在保持基础临床情境不变的文本扰动下进行比较。我们构建了一个包含超过6,000个临床情境、7,000项医生标注和225,000条模型回答的基准。利用该基准,我们得到两项主要发现。首先,在基线条件下,大语言模型比医生更容易建议不必要的医疗照护,而且这种倾向在输入受到扰动时进一步增强。其次,我们发现大语言模型的建议对性别和语气扰动比人类建议更敏感。这些结果共同表明,大语言模型的表现会随与临床无关的文本变化而改变,凸显出开展面向部署、以专家医生行为为依据的评测的必要性。