论文
通过上下文对齐的视觉语言模型实现负责任的多模式医学推理
Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
摘要
医学视觉语言模型 (VLM) 在放射学任务中表现出强大的性能,但由于过度依赖主导模式,常常会产生流畅但基础薄弱的结论。我们引入了一个上下文一致的推理框架,该框架在生成诊断结论之前强制跨异质临床证据达成一致。所提出的方法通过源自放射组学统计、可解释性激活和基于词汇的语义线索的结构化上下文信号增强了冻结的 VLM。该模型不是生成自由形式的响应,而是生成包含支持证据、不确定性估计、限制和安全说明的结构化输出。我们观察到,仅辅助信号提供的益处有限;仅当通过上下文验证集成这些信号时才会出现性能提升。胸部 X 射线数据集的实验表明,上下文对齐可以提高判别性能(AUC 0.918 至 0.925),同时保持校准的不确定性。该框架还大幅减少了幻觉关键字(1.14 至 0.25),并生成更简洁的推理解释(19.4 至 15.3 个单词),而无需增加模型置信度(0.70 至 0.68)。 CheXpert 上的跨数据集评估进一步揭示模态信息量显着影响推理行为。这些结果表明,执行多证据一致性可以提高医学多模态推理的可靠性和可信度,同时保留底层模型架构。