论文

临床医生对语言模型的使用与模型的评估方式不同

Clinician use of language models diverges from how the models are evaluated

模型评测应用与实践评测方法与指标行业应用

摘要

大语言模型(LLM)助理正在被部署到各个卫生系统的临床医生使用,对他们准备情况的判断主要取决于基准分数,其中大部分来自考试问题或策划的案例。基准测试仅在其项目与实际使用相似的情况下预测部署性能,但基准测试是否反映这些系统收到的工作却很少被测量。在此,我们分析了 35 个专业的 6,342 名医生、高级临床执业人员和护士在为期 8 个月的推出期间向机构助理发送的 127,833 条查询。我们使用 RCQ-Map 描述每个查询的特征,RCQ-Map 是一个经过临床医生验证的框架,基于临床问题分类和LLM评估,记录其任务、意图、可回答性、缺失信息和潜在危害。文档和管理(36.2%)和知识检索(28.9%)占使用的近三分之二,诊断占 3.7%;超过三分之一的查询按原样提出时无法得到良好回答。将 RCQ-Map 应用于来自主要评估套件及前沿模型报告的58个公开基准,并汇集成临床AI基准图谱,结果显示,中位基准不包含任何文档请求,并且共享实际使用的任务组合的 31%,低于跨任务类别的均匀分布。旨在模拟临床实践的套件中的基准单独而言并不比前沿模型报告中使用的基准更接近实际使用。因此,基准分数很少说明临床人工智能在实际完成的大部分工作中的表现,评估应与实际临床使用相匹配。