论文
临床AI工具在真实诊疗点临床查询上的专家评估
Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries
摘要
医生现在每周向AI工具提出数百万个临床问题——但这些工具大多在假设或考试式问题上评估——而非实践中实际提出的问题。我们报告建立在620个真实诊疗点查询(Real-POCQi)上的盲评——这些查询由横跨30个专科的医生提交至OpenEvidence(OE)平台——另有187个来自HealthBench的问题。横跨36个州的149名执业医师在三个前沿通用模型(Claude Opus 4.8、Gemini 3.1 Pro与GPT-5.5)与专门临床工具(OE)的回答间做正面对比——评分者与每题专科匹配。当沿与临床决策支持相关的五个维度——准确性、临床效用、来源质量、可验证性与完整性——比较回答时——医生在所有轴上给专门工具最高分;在Real-POCQi主分析中——胜差(胜率与败率之差)介于25至39个百分点(p<0.001)。结果在按引用展示、答案长度、OE用户身份及Real-POCQi对比HealthBench分层的敏感性分析中保持一致。同时——LLM裁判被发现系统性区别于专家裁判——尽管两者对最佳模型大体一致。这些发现强调两个结论:(i) AI工具评估应反映真实查询分布——并使用映射现代医学专科性的专家裁判;(ii) 专门工具对通用模型的一致优势未必意味着后者不能服务类似目的——而是定向工程与定制化能为其用户带来有意义的性能增益。我们发布Real-POCQi作为公开基准——以及用于复现本研究结果的预设统计分析。
