论文

健康AI评估中的效度缺口:基准构成的横断面分析

The Validity Gap in Health AI Evaluation: A Cross-Sectional Analysis of Benchmark Composition

模型评测评测方法与指标

摘要

背景:临床试验依赖透明的纳入标准以确保可推广性。相比之下,用于验证健康相关大语言模型(LLM)的基准很少刻画其所包含的“患者”或“查询”人群。在没有明确构成的情况下,总体性能指标可能误判模型在临床应用上的就绪程度。方法:我们使用LLM作为自动化编码工具,对六个公开基准中的18,707条消费者健康查询进行分析,应用标准化的16字段分类体系来刻画背景、主题与意图。结果:我们识别出一种结构性的“效度缺口”。尽管基准已从静态检索演进为交互式对话,其临床构成仍与现实需求错位。语料中虽有42%引用了客观数据,但严重偏向以保健为目的的可穿戴信号(17.7%);复杂的诊断输入仍然罕见,包括实验室数值(5.2%)、影像(3.8%)和原始医疗记录(0.6%)。安全关键场景实际上缺位:自杀/自伤查询仅占语料的不到0.7%,慢性病管理仅占5.5%。基准还忽视了脆弱人群(儿科/老年人不到11%)与全球健康需求。结论:评估基准仍与现实临床需求错位,缺乏原始临床资料、对脆弱人群的充分呈现以及纵向慢病照护场景。该领域必须采用标准化的查询画像——类比于临床试验报告——使评估与临床实践的完整复杂性保持一致。

健康AI评估中的效度缺口:基准构成的横断面分析:论文配图
图1:CONSORT流程图,展示研究从初始评估、标注方法到最终分析数据集的筛选与纳入流程。