论文

超越对称对齐:医学领域视觉语言模型模态不平衡的光谱诊断

Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

模型评测评测方法与指标

摘要

视觉语言模型 (VLM) 在应用于医学图像文本数据时会遇到困难,但可用于诊断这种故障的工具仍然有限。现有的表示对齐度量是对称的,将两种模态压缩为单个分数并隐藏哪种模态驱动跨模态降级。我们引入了谱对齐得分(SAS),这是一种非对称度量,它将两种模态投影到锚模态的主特征基上,并计算特征值加权的每个特征模相关性,从而产生方向得分,其差异量化了模态信息不平衡。我们将 SAS 嵌入到基准测试框架中,评估跨自然和医学图像文本数据集的 15 个 VLM,以及 6 个对齐指标和双向检索。我们的实验表明,医学图像比配对的临床报告保留了更丰富的结构信息,所有竞争指标都看不到方向不对称性,并且 SAS 与医学领域的检索性能实现了最强的零标签相关性,将其定位为临床部署的实用诊断工具。代码可通过以下 URL 获取:https://github.com/iamalegambetti/medical-vlms-assessment。