论文

前沿大语言模型在遵循指南及针对具体病例的肿瘤决策中的共同能力边界

A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making

模型评测模型能力评测

摘要

大语言模型(LLM)在医学知识考试中取得了高分,但现实世界的肿瘤学并不是知识测试,而是一系列指南路径选择、升级判断和不确定性下的承诺。现有的基准主要衡量事实回忆,而前沿LLM是否存在组合模型无法修复的决策路径盲点仍悬而未决。我们建立了肿瘤学决策边界基准 (ODBB)——跨越 NCCN 指南和结直肠癌病例的 2,005 个肿瘤学决策点——并评估了 2025 年 6 月至 2026 年 4 月期间发布的 9 个前沿LLM(4 个闭源、5 个开放权重系列)。完全确定性评分器(零 LLM 推断)将输出分为 14 种失败类型,由两名肿瘤学家独立验证(科恩加权)对于 225 项分层样本,$κ$ = 0.939 和 0.790)。将这九个项目视为汇总的超级模型,所有项目中的 42.1%(威尔逊 95% CI 40.0--44.3%)——1,586 个 NCCN 项目中的 35.7% 和 419 个结直肠癌病例中的 66.4%——都没有正确回答,失败集中在在推理之前在指南路径之间进行选择:临床中一致的盲点元判断可能需要架构干预而不是更多的训练数据。两个针对果断性进行调整的模型(GPT-5.5、Gemini 3.1 Pro Preview)做出不安全承诺的频率是七个谨慎模型的三到五倍,但得分却没有更高。在 3--9% 的项目中,模型陈述了正确的下一步临床步骤,但没有承诺执行——决策失败,而不是知识失败。模型质量不再是临床LLM部署的主要瓶颈;约束约束是假设任何单一模型都可以作为临床决策的唯一基础。进步需要架构能够检测模型何时达到其能力边界并将决策发送给临床医生。

前沿大语言模型在遵循指南及针对具体病例的肿瘤决策中的共同能力边界:论文配图
图 1:自动基准生成管道。