论文

MedARC:3D 医学视觉语言模型的视觉词元的 无需训练 自适应冗余压缩

MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

模型推理推理加速

摘要

将 3D 医学图像与视觉语言模型 (VLM) 集成为计算机辅助诊断带来了巨大的希望。然而,体积图像会生成非常长的视觉标记序列,具有相当大的空间和切片间冗余。现有的标记压缩方法通常应用统一减少或依赖于单个重要性信号,增加了删除与查询临床相关或结构独特的区域的风险。为了解决这个限制,我们提出了 MedARC,这是一个统一的 无需训练 框架,用于 3D 医学 VLM 中视觉标记的自适应冗余压缩。 MedARC 通过整合三个互补线索来估计 token 重要性:来自 VLM 视觉编码器的自我注意力,它反映了模型的内在视觉焦点;投影视觉标记和文本嵌入之间的相似性,用于识别与查询相关的区域;局部视觉基础模型特征与体积级特征中心的偏差,突出了结构上独特的解剖结构。由此产生的重要性分布指导显着性感知合并策略,该策略保留信息标记,同时合并冗余标记,而不是简单地丢弃它们。 CT-RATE 和 MR-RATE 的实验表明,MedARC 减少了视觉标记开销和推理时间,同时保持或提高了诊断性能。处理更少标记所节省的成本超过了其多线索评分成本,预计更大的语言模型会带来更大的好处。