论文

根据超声报告改进 O-RADS 风险分层:混合与端到端 LLM 推理策略的比较评估

Improving O-RADS Risk Stratification from Ultrasound Reports: A Comparative Evaluation of Hybrid versus End-to-End LLM Reasoning Strategies

模型评测模型能力评测

摘要

背景:由于可靠性、幻觉和可解释性有限,使用 大语言模型 (LLM) 自动化基于临床指南的决策仍然具有挑战性。我们比较了 LLM 的性能以及来自自由文本盆腔超声报告的自动卵巢附件报告和数据系统 (O-RADS) 分类的推理策略。方法:在这项回顾性研究中,纳入了连续接受盆腔超声检查的卵巢肿块患者。使用三种推理策略对八个 LLM 进行了测试:隐式知识端到端、规则通知端到端以及将特征提取与基于规则的分类分离的基于特征的混合架构。参考标准是专家共识制定的O-RADS分类。结果:共有 310 名女性的 390 个卵巢肿块接受了评估。使用 Gemini 3.6 Flash 的基于特征的混合架构表现出了最佳性能,准确率达到 99.2%(390 中的 387),与参考标准几乎完美一致(加权 kappa = 1.00;95% CI:0.99-1.00)。其性能超过了原始临床报告(准确度,87.7% [390 中的 342];加权 kappa = 0.94;95% CI:0.91-0.96)和端到端 LLM 策略(准确度范围,65.6% [390 中的 256] 至 95.9% [374] 390])。对于结构化特征提取,Gemini 3.6 Flash 表现出比 Claude Fable 5 更高的整体准确率(98.9% vs 97.8%;P < 0.001)。混合架构减少了错误分类错误,并减轻了原始报告中观察到的过度分类趋势。结论:基于特征的混合 LLM 架构将临床特征提取与确定性指南执行分开,可实现高度准确、可靠且可解释的自动化 O-RADS 分类,为标准化、基于指南的临床决策提供一种有前景的方法。