论文

通用增强器,特定抑制器:医学视觉语言模型的稀疏自动编码器控制

Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models

模型推理解码与生成控制

摘要

医学视觉语言模型 (VLM) 在生成胸部 X 光报告时经常会产生幻觉:它们会捏造图像中不存在的发现、遗漏重要的发现或错误地定位它们。我们通过基于每个词元稀疏自动编码器(SAE)的解码时残差控制来缓解这种情况,而无需权重更新:后期层上的 Top-$K$ SAE,针对临床错误的因果控制,然后在推理时结合抑制/增强干预。在 MIMIC-CXR 测试拆分中,我们的纯推理方法提高了三个放射学 VLM(RadVLM、LLaVA-Rad 和 CheXOne)生成报告的质量,临床综合指标相对提高了 +5.4%、+7.2% 和 +17.0%,并且所有主干上的 GREEN 增益具有统计显着性。跨模型特征对齐表明,质量促进(提升)方向在架构之间强烈重叠,而幻觉相关(抑制)方向是特定于模型的。因此,可转移转向必须针对每个骨干网进行抑制,而不是共享通用抑制列表。同样的方法将零样本转移到 IU-Xray(绿色 $+7.7\%$ rel.),无需重新训练,确认识别的特征是模型的属性,而不是训练语料库的属性。我们发布了因果功能集和交互式功能仪表板:https://cxr-sparse-feature-dashboard.netlify.app/。