论文

融合并非一刀切:面向时间到事件预测的跨模态表示对齐

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

模型架构混合架构

摘要

由于模态不平衡和分布变化,根据多模态临床数据准确预测事件发生时间 (TTE) 仍然具有挑战性。我们引入了一个基础模型驱动框架,用于 CT 成像和纵向 EHR 数据之间的跨模式表示对齐,旨在跨任务和机构进行泛化。 CT 和 EHR 模式使用特定领域的基础模型独立编码,并通过四种原则融合策略在共享潜在空间中对齐:后期融合、对比对齐、交叉注意和共同注意。我们在大规模多机构队列中评估了两项临床上不同的 TTE 任务:肺栓塞 (PE) 死亡率和心血管疾病 (CVD) 结果(PE:N=3,099 组;1,098 组内部;435 组外部;CVD:N=2,951 组;837 组内部;682 组外部)。当模态贡献相当时,融合比单模态基线始终将一致性指数提高 1.5-5.4%。总体而言,对比多模态融合,尤其是 CLMBR 表示,提供了最一致和统计上最稳健的改进,特别是对于 PE 死亡率预测。对于MACE,交叉注意力(one-hot)实现了最高的内部性能,图像引导的共同注意力实现了最佳的外部性能。因此,我们引入了一种基于通用基础模型的跨模态对齐框架,并对 TTE 预测中模态不平衡下的融合行为进行了首次系统分析。我们的结果将任务感知多模态对齐确立为稳健泛化和可扩展临床部署的必要设计原则。

融合并非一刀切:面向时间到事件预测的跨模态表示对齐:论文配图
图 1:多模态生存框架和融合策略概述。使用特定领域的基础编码器对胸部 CT 和纵向 EHR 进行跨模态对齐,生成用于事件时间预测的共享嵌入,并使用从各自编码器导出的仅图像和仅 EHR 基线。潜在空间中的融合变体 - (a) 嵌入的传统串联,建议 - (b) 对比学习,(c) 共同注意,以及 (d) 对称交叉注意。