论文

RareLens:通过调和分歧的大语言模型推理迈向端到端罕见病诊疗

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

模型推理推理验证与自校正

摘要

罕见病是临床决策最具挑战性的场景之一:异质性的表现、稀疏的证据与有限的专业知识在整个诊疗路径上造成持续的不确定性。尽管人工智能可以提供帮助,现有系统大多只处理孤立任务(尤其是诊断),且通常依赖下游检查而非初诊时即可获得的信息。我们在此表明,不确定性下的临床AI性能可以通过利用多个不完美推理系统的多样性来改善,而不是靠扩展单一模型。在异构大语言模型之间,我们识别出具有互补错误模式的分歧推理轨迹,并开发RareLens,学习把这些视角调和为覆盖罕见病诊疗四个阶段——风险筛查、诊断、治疗规划与预后预测——的可执行决策。RareLens建立在RarelensBench之上,这是一个包含157,525例、覆盖全部33个Orphanet类别和7,000多种疾病的真实世界数据集;RareLens在所有阶段都优于受测的每个前沿模型,包括GPT-5、DeepSeek-R1、Claude-3.7-Sonnet和Gemini-2.5-Pro。它在筛查上取得0.917的曲线下面积(AUC),诊断与治疗的top-1准确率分别为65.5%和89.8%。在涉及1,287个病例和23名医生的外部评估中,自主运行的RareLens和由RareLens辅助的医生都优于无辅助的医生,同时表明有效的人机协作不只是简单地提供模型输出。这些发现确立了分歧模型推理作为一种可利用的信息来源,并为构建在高临床不确定性下可靠运行的AI系统提示了一条通用策略。