论文

LUX:用于可解释内窥镜字幕的病变感知图形条件视觉语言架构

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

上下文与知识知识图谱

摘要

溃疡性结肠炎内窥镜图像的解释是复杂且主观的,人类评估和微妙的粘膜炎症存在差异。尽管深度学习具有先进的自动化分析功能,但大多数视觉语言模型依赖于全局视觉嵌入,而忽略了病理证据的局部性和相关性,限制了临床可靠性和可解释性。我们引入了 LUX(病变感知统一可解释字幕),这是一种用于可解释内窥镜图像字幕的图形条件视觉语言架构。 LUX 从 Grad-CAM 和 CBAM 激活图构建以病变为中心的场景图,将病理区域表示为节点,并对它们的空间和临床关系进行编码。这些图嵌入被集成到 T5 解码器的交叉注意层中,使生成的单词能够关注特定的病变节点,而不仅仅是全局图像特征。这提供了语言内容和病理证据之间的直接一致性,支持 词元级 可解释性和关系推理。 LUX 的性能优于 BLEU、METEOR、ROUGE-L 和 CIDEr 等强大的基线和最先进的医疗字幕模型,其中 CIDEr 的收益尤其强劲。它还通过生成的标记和局部病理区域之间更强的对应性来减少幻觉的临床结果并改善病变水平的基础。