论文

临床AI工具在真实诊疗点临床查询上的专家评估

Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries

模型评测基准与评测资源

摘要

医生现在每周向AI工具提出数百万个临床问题——但这些工具大多在假设或考试式问题上评估——而非实践中实际提出的问题。我们报告建立在620个真实诊疗点查询(Real-POCQi)上的盲评——这些查询由横跨30个专科的医生提交至OpenEvidence(OE)平台——另有187个来自HealthBench的问题。横跨36个州的149名执业医师在三个前沿通用模型(Claude Opus 4.8、Gemini 3.1 Pro与GPT-5.5)与专门临床工具(OE)的回答间做正面对比——评分者与每题专科匹配。当沿与临床决策支持相关的五个维度——准确性、临床效用、来源质量、可验证性与完整性——比较回答时——医生在所有轴上给专门工具最高分;在Real-POCQi主分析中——胜差(胜率与败率之差)介于25至39个百分点(p<0.001)。结果在按引用展示、答案长度、OE用户身份及Real-POCQi对比HealthBench分层的敏感性分析中保持一致。同时——LLM裁判被发现系统性区别于专家裁判——尽管两者对最佳模型大体一致。这些发现强调两个结论:(i) AI工具评估应反映真实查询分布——并使用映射现代医学专科性的专家裁判;(ii) 专门工具对通用模型的一致优势未必意味着后者不能服务类似目的——而是定向工程与定制化能为其用户带来有意义的性能增益。我们发布Real-POCQi作为公开基准——以及用于复现本研究结果的预设统计分析。

临床AI工具在真实诊疗点临床查询上的专家评估:论文配图
图 1:基准数据集的研究设计和组成。专业匹配、获得许可且积极执业的美国医生通过随机、盲法、成对设计,针对现实世界的临床决策支持问题评估了四种基于聊天的医疗人工智能系统——GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8 和 OpenEvidence (OE)。 a、研究原理图。问题库 (Real-POCQi) 源自去​​识别化和重写的 OE 真实用户查询,在 36 个专业(IQVIA 数据库)中进行采样,并根据排除标准进行过滤; HealthBench 问题还被纳入敏感性分析。每个评估者都被分配了一个始终固定的渲染模式——纯文本(主要)或带有引文的文本(次要);对于每个问题,都会从四个系统中随机抽取一对,并且两个答案显示在随机 A/B 位置,同时隐藏和呈现相同的供应商身份。每项比较均按照从 A 更好到 B 更好的五点偏好量表,从五个维度(准确性、临床实用性、来源质量、可验证性和完整性)进行独立评级。 b,数据集中采样和评分问题中每个专业领域的流行率。 c,通过基于 LLM 的聚类确定的问题类型在数据集中的分布。