经导管主动脉瓣置换(TAVR)规划需要细致的多模态推理。但把多模态大语言模型(MLLM)适配到这一高风险域被诊断幻觉严重阻碍——生成文本缺乏解剖学锚定。为此——引入TAVR-VLM:以风险条件化因果锚定注意力(R-CGA)为特色的新框架——实例化模型内“风险→区域→词”的结构化锚定通路。R-CGA把多模态输入压缩为因果风险瓶颈——把稠密视觉特征提纯为全局风险掩码。在自回归生成期间——支撑投影的因果一致性目标把token级锚定约束在风险定义的支撑掩码内。在1,482患者队列M³TAVR上评估——TAVR-VLM创下新SOTA:AUROC 0.896、CIDEr提升到0.936——并把幻觉率大幅降到8.1%——从而改进循证手术AI的可解释性。
图 1:TAVR-VLM 架构概述。 R-CGA 实现了模型内部的“Risk →\rightarrow Region →\rightarrow Word”结构锚定路径。第 1 阶段将 3D CT、超声心动图片段和临床参数编码到联合嵌入中,预测风险分布 PriskP_{\mathrm{risk}},并构建因果风险瓶颈 Zrisk=Prisk⊤WZ_{\mathrm{risk}}=P_{\mathrm{risk}}^{\top}W。第 2 阶段使用 ZriskZ_{\mathrm{risk}} 作为查询,CT 视觉标记作为键/值特征,以获得全局风险掩码 MglobalM_{\mathrm{global}},从中导出风险定义的支持掩码 Bglobal=TopKρ(Mglobal)B_{\mathrm{global}}=\mathrm{TopK}{\rho}(M{\mathrm{global}})。第 3 阶段根据风险激活的视觉特征 VactV_{\mathrm{act}} 生成结构化报告,同时将原始标记注意力 MtM_{t} 投影到 BglobalB_{\mathrm{global}} 中,以获得受约束的标记掩码 M~t\widetilde{M}_{t}。因果一致性损失使 M~t\widetilde{M}_{t} 与全局风险掩模保持一致,并惩罚风险定义支持之外的注意力。