论文

面向AI辅助鉴别诊断的安全导向假设演绎框架

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

智能体系统Agent 架构与控制循环

摘要

诊断错误是患者安全的主要威胁,但当前大语言模型(LLM)系统常把诊断当作一次性预测任务——缺乏防止遗漏高风险替代项或严格验证推理的保障。我们提出AegisDx:面向安全的假设演绎临床推理框架。AegisDx经角色专属契约、结构化中间输出、证据检索接口与验证门协调专职LLM组件:生成广泛的鉴别诊断、强制对危险的“绝不能漏”病症做显式筛查、对照落地的医学证据验证推理,并结构化可行动的下一步。我们跨三层评估AegisDx。在来自NEJM与JAMA的文献案例报告上(GPT-oss-120B为共享骨干):JAMA案例Top-3诊断准确率59.9%对独立LLM的52.1%;NEJM案例62.7%对51.4%。在Annals of Emergency Medicine案例上:Top-3准确率85.7%对68.6%;对照医师共识的绝不能漏诊断集:AegisDx在其前三个诊断中至少捕获一种该类病症的比率为78.0%对52.0%。在与GPT-5对比的、来自耶鲁纽黑文卫生系统43份真实急诊记录的盲法医师评估中:AegisDx把医师评定的综合安全分从4.31提升到4.55(5分制,调整后p=2.1e-4),在绝不能漏识别与推理安全上有质性增益。结果表明:把诊断AI工程设计为安全导向的推理框架——而非仅优化原始预测准确率——能为急性诊疗工作流提供更安全、更透明、临床有意义的床边决策支持层。

面向AI辅助鉴别诊断的安全导向假设演绎框架:论文配图
图 1:AegisDx 诊断推理框架概述。 (a) 将自由文本临床描述映射到 Top-33 鉴别诊断列表、Top-33 不容错过的条件、带有参考的可追踪推理以及结构化管理计划的示例输入输出视图。 (b) AegisDx 跨假设生成、证据收集和验证以及临床管理的阶段性组织,包括专业假设生成、不容错过的安全检查、差异整合、证据检索、临床推理、假设验证、建议的下一步诊断步骤和早期管理考虑。 (c) 四个数据集和三种补充评估方法的总结:公共文献衍生基准的 Top-kk 诊断准确性、Annals of EM 的不容错过的诊断覆盖率以及对 YNHHS 真实世界临床记录队列的盲法医生评估。