论文

CACSurv:用大语言模型做一致性对齐比较学习预测癌症生存

CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction

模型训练强化学习

摘要

癌症生存预测支持治疗规划、风险分层和随访管理。现有方法使用结构化临床变量、全切片图像、基因组图谱或多模态输入,而患者报告仍未被充分探索。我们研究以报告为中心的生存预测,所用报告组织了病理、临床和分子证据。大语言模型(LLM)可以在这类报告上推理,但按病例的时间回归引入两个失配。第一是形式失配:生存评估依赖于对可比较患者的排序,而独立的时间预测不强制排序一致性。第二是监督失配:删失患者的观测时间仅表明其生存超过该点,不能作为精确的回归目标,尽管它仍隐含相对于更早死亡患者的排序。为解决这些失配,我们提出CACSurv,一个面向以报告为中心的生存预测的一致性对齐比较框架。CACSurv把生存建模重构为迷你队列比较推理,由LLM预测相对预后排序。我们引入在右删失下由可比较关系导出的一致性对齐奖励,使删失结局无需精确事件时间目标即可提供排序监督。推理时,蒙特卡洛参考聚合把每位患者与采样的参考比较,并把位置聚合成队列级排序。我们建立了覆盖六个TCGA癌症队列的基准TCGA-SurvReport。CACSurv在全部六个队列上取得最高C-index,平均C-index为0.722,领先已发表最强生存模型6.5个百分点、最强LLM时间回归基线4.2个百分点。我们的代码、模型和数据集将在https://github.com/xmed-lab/CACSurv提供。

CACSurv:用大语言模型做一致性对齐比较学习预测癌症生存:论文配图
图1:生存预测建模范式的比较。(a) 传统 WSI/多模态模型预测逐病例的风险评分。(b) 直接基于报告的 LLM 进行逐病例的时间回归,但在最后一次随访时仍存活的患者缺乏精确时间目标。(c) CACSurv 通过可靠的相对比较直接在一个小型队列内对患者排序。