论文
证据扎实的亚专科推理:在 2025 年内分泌学委员会式考试上评估精选临床智能层
Evidence-Grounded Subspecialty Reasoning: Evaluating a Curated Clinical Intelligence Layer on the 2025 Endocrinology Board-Style Examination
摘要
背景:大语言模型在通用医学考试上表现出色,但由于指南快速演进和证据层级精细,亚专科临床推理仍具挑战。方法:我们在 120 题的内分泌学委员会式考试上,将证据扎实的临床推理系统 January Mirror 与前沿 LLM(GPT-5、GPT-5.2、Gemini-3-Pro)对比。Mirror 整合精选的内分泌与心脏代谢证据语料库和结构化推理架构,生成带证据链接的输出。Mirror 在封闭证据约束下运行,不做外部检索。对照 LLM 可实时访问网络上的指南与原始文献。结果:Mirror 达到 87.5% 准确率(105/120;95% CI:80.4-92.3%),超过 62.3% 的人类参照以及 GPT-5.2(74.6%)、GPT-5(74.0%)和 Gemini-3-Pro(69.8%)等前沿 LLM。在最难的 30 题上(人类准确率低于 50%),Mirror 达到 76.7% 准确率。Top-2 准确率 Mirror 为 92.5%,GPT-5.2 为 85.25%。结论:Mirror 提供证据可追溯性:74.2% 的输出引用了至少一个指南级来源,人工核验引用准确率 100%。对亚专科临床推理而言,带明确出处的精选证据可以胜过不受限的网络检索,并支持临床部署所需的可审计性。
