论文
扩展临床判断以评估医疗AI
Scaling Clinical Judgment to Evaluate Medical AI
摘要
盲法医师评估被视为评估大语言模型(LLM)临床推理能力的金标准。然而,这种评估难以规模化;因此,以往研究通常依赖于少量医师小组,多来自单一机构或专业领域,这限制了科学问题的探索,并使结果在不同评估者群体中的可重复性存疑。为更严谨且可扩展地研究AI模型的临床推理能力,我们提出了PrecepTron,一种经过微调以实现医师级评分的LLM,用于对开放性回答进行评估。PrecepTron通过在320亿参数模型上使用低秩适应(LoRA)技术,基于少量医师示例进行训练。我们还发布了GRAND-ROUNDS,一个包含9,217个评分、由11名医师在七个研究中完成的大型医师标注基准数据集。我们发现,主流的"LLM作为裁判"方法中的前沿LLM经常与医师及彼此意见不一致,但通过在少量案例上微调PrecepTron,可实现跨任务的医师级一致评分。我们利用PrecepTron在无需新增人工评分的情况下,复现了五项发表于JAMA、Science和Nature Medicine中的重要研究的结论。随后,我们提出了一系列新问题,探讨LLM在医学中的推理机制,这些在纯人工评分下是不可行的,例如在临床病例分段提供(甚至逐个token)的情况下,测量前沿LLM的诊断准确性。PrecepTron与GRAND-ROUNDS共同为大规模、可复现地研究LLM在医学中的推理机制提供了基础。所有代码、数据和标签均免费向研究者开放。