论文

迈向肝细胞癌的精准治疗:用于风险分层与治疗指导的临床推理LLM

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

模型训练强化学习

摘要

肝细胞癌(HCC)是常见恶性肿瘤和癌症相关死亡率的主要原因。现行指南与分期系统提供粗粒度类别,但常错过分期内的异质性与电子病历(EMR)中的临床情境。我们提出HCC-STAR(肝细胞癌分期、治疗与预后):临床对齐的大型语言模型——读取常规EMR叙事并联合输出基于风险评分的分期、带循证理由的排序指南一致治疗,以及个体化生存估计。我们从SEER策展约30,000例HCC案例,并经临床医生验证的基于提示的增广工作流扩展为EMR风格叙事训练数据。在该语料上,我们开发经步级可验证复合奖励优化的知识对齐推理框架——超越临床指南的文本级记忆。在中国12家医院6,668例患者的多中心队列中:HCC-STAR在治疗推荐与风险分层上取得相比临床指南与竞争模型(包括GPT-5与Gemini-2.5 Pro)的最先进表现。假设性总生存分析显示:遵从HCC-STAR推荐的中位生存为51个月,对比BCLC的29个月与CNLC的32个月。在以临床医生为中心的评估中:盲法肝胆专科医师评定HCC-STAR的推理与循证论证可信;模型在治疗准确率上超过住院医与主治医师,并在作为助手使用时帮助医生更快做出更准确的决策。结果支持HCC-STAR作为HCC风险分层与精准治疗的可靠可验证决策支持系统。

迈向肝细胞癌的精准治疗:用于风险分层与治疗指导的临床推理LLM:论文配图
图 1:HCC-STAR 概述:数据管理、模型开发和评估。 a、数据采集、增强和协调。来自 SEER 的 HCC 记录经过清理和标准化,真实世界的 EMR 被标准化为模板。 CNLC 指导、经过临床验证的提示管道将关键变量扩展到指令式 EMR 叙述中。然后,结构化矩阵和叙述被统一到跨源语料库中。 b、模型训练。第一阶段:对类似 EMR 的叙述进行临床知识熟悉微调。第 2 阶段:经验累积强化学习,具有临床定制的复合奖励(过程/格式正确性、指南一致的治疗排名、生存估计、简洁性和思想链 (CoT) 质量)。 c,模型输出。给定 EMR 式输入,HCC-STAR 返回 (i) 类别概率和具有与指南相关的基本原理的排名治疗列表,(ii) 通过分位数校准的基于风险评分的阶段,以及 (iii) 患者特定的生存估计(月)以及风险等级。 d、模型验证。内部 (SEER) 和外部多中心队列使用 Top-kk 准确性、Harrell’s C-index、AUROC 和 Kaplan-Meier 分析,将我们的模型与分期系统(AJCC/TNM、BCLC、CNLC)、代表性大语言模型和经典 ML 进行基准测试。 e,大语言模型生成内容的临床比较和评估。我们与医生进行评估并比较三种设置:仅医生、仅大语言模型以及获得大语言模型协助的医生。盲法肝胆专家对 CoT 的完整性、正确性、安全性和循证论证的可靠性进行评分。