论文

AI 生成的预授权信函:临床内容强,行政要件弱

AI-Generated Prior Authorization Letters: Strong Clinical Content, Weak Administrative Scaffolding

模型评测模型能力评测

摘要

预授权(Prior Authorization)仍然是美国医疗体系中负担最重的行政流程之一,每年消耗数十亿美元和数千小时的医生时间。尽管大语言模型在各类临床文本任务上已展现出潜力,但其生成可直接提交的预授权信函的能力仅受到有限关注,现有工作局限于单案例演示,而非结构化的多场景评估。我们在 45 个经医生验证的合成场景上评估了三种商用 LLM(GPT-4o、Claude Sonnet 4.5 和 Gemini 2.5 Pro),场景涵盖风湿病学、精神医学、肿瘤学、心脏病学和骨科。三个模型生成的信函都具有很强的临床内容:诊断准确、医疗必要性论证结构清晰、阶梯治疗(step therapy)记录完整。然而,对真实世界行政要求的二次分析揭示了一致的缺口,这些缺口是单靠临床评分无法捕捉的,包括缺少计费代码、缺少授权时长请求以及随访计划不充分。这些发现重新界定了问题:临床部署的挑战不在于 LLM 能否写出临床合格的信函,而在于围绕它们构建的系统能否提供支付方(payer)工作流所要求的行政精确性。

AI 生成的预授权信函:临床内容强,行政要件弱:论文配图
图3:各模型与临床专科的平均总分(每格n=9),全部超过11.5/12,满分12.00加粗显示。