论文

用树形语法分析支持的加权 Banzhaf 交互解释 BiomedCLIP

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 在放射学分析等医疗任务中展示了重要的功能,但提供忠实且可解释的解释仍然是其在临床环境中负责任部署的关键考虑因素。然而,现有的解释方法,例如广泛使用的 FIxLIP 框架,经常与现代分词器的细粒度性质相矛盾。标记化问题使临床概念支离破碎——将“鞍形栓子”等术语分割成分散的、无意义的子词——这导致了嘈杂的、语义上不连贯的跨模态归因。这种碎片化还会导致交互可能性的组合爆炸,从而掩盖了模型的真实推理。为了解决这个问题,我们引入了 ParseFIxLIP,这是一个将 Tree-Gram 解析合并到 FIxLIP 使用的 Banzhaf 交互游戏中的扩展。这种语义通知策略利用依存解析树通过将相关文本标记分组为语义连贯的单元来定义解释参与者。我们的 smart_depth 分组策略,根据 spaCy 词元依赖树合并词元,成功地减轻了概念碎片化,通过统一复杂的医学概念,产生了更可解释的跨模式交互。从数量上讲,虽然基线与长图像描述的高维性作斗争,但我们的解析方法保持了统计稳健性和语义简约性。对 BiomedCLIP 的定性分析,在医学图像 (ROCOv2) 和一般示例上进行了验证,证实该方法准确地捕捉了分组词对模型预测的协同影响。总之,我们的工作为 VLM 决策提供了直观且与临床相关的见解,满足了医学领域对连贯解释的关键需求。