论文

RareAlert:对齐异构大语言模型推理以实现早期罕见病风险筛查

RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening

摘要

漏诊和延迟诊断仍是罕见病诊疗的主要挑战。在初次临床就诊时,医生需在高不确定性下仅凭有限信息评估罕见病风险。当高危患者在此阶段未被识别时,针对性的诊断检测往往不会启动,导致漏诊。现有初级分诊流程在结构上不足以在初次临床表现时可靠识别罕见病患者,需要普遍性筛查来减少诊断延迟。在此我们提出RareAlert,一个利用常规初诊信息预测患者级罕见病风险的早期筛查系统。RareAlert整合十个LLM生成的推理,使用机器学习对这些信号进行校准与加权,并将对齐后的推理蒸馏为单个可本地部署的模型。为开发和评估RareAlert,我们构建了RareBench,一个包含158,666例、覆盖33个Orphanet疾病类别和超过7,000种罕见病的真实数据集,同时包括罕见病与非罕见病表现。结果表明,罕见病识别可被重新概念化为应用于全患者群体的通用不确定性消解过程。在独立测试集上,基于Qwen3-4B、用校准推理信号训练的RareAlert取得0.917的AUC,优于最佳机器学习集成及所有受评LLM,包括GPT-5、DeepSeek-R1、Claude-3.7-Sonnet、o3-mini、Gemini-2.5-Pro和Qwen3-235B。这些发现证明了LLM医学推理的多样性以及在高不确定性临床任务中对齐此类推理的有效性。通过将校准推理融入单一模型,RareAlert实现了准确、保护隐私且可扩展的罕见病风险筛查,适合大规模本地部署。