将推理时间控制转化为放射学视觉语言模型:胸部 X 光肺炎分类的激活指导
Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays
摘要
推理时间工程可以在没有 微调 的情况下改变模型行为。然而,其在提高医学视觉语言模型(VLM)诊断性能方面的效用仍不清楚。我们的目的是评估对比激活附加 (CAA) 是否可以在不更新模型权重的情况下改善胸片 VLM 中的肺炎分类。在公共 Kermany 肺炎测试集上评估了三个冷冻胸片 VLM(MedGemma-4B-IT、NV-Reason-CXR-3B 和 CheXOne-3B)。分类基于二进制提示下标记 Yes 和 No 的 logits。引导向量包括 30 对答案偏差对照、30 对肺炎文本对比以及源自 30 个肺炎和 30 个正常发育图像的图像条件对比。确定性的 200 个图像开发集用于图层和比例选择(100 个图像)和阈值校准(100 个图像)。使用 ROC-AUC、PR-AUC、F1 评分、阈值分析、反向向量对照、随机向量对照和条件引导置信区间评估性能。经常观察到固定阈值 F1 的改进,但并不始终表明诊断性能有所提高。适用于 MedGemma-4B-IT。 NV-Reason-CXR-3B 显示出最强的优势:校准后的 F1 从零样本设置中的 0.7692 提高到肺炎文本转向的 0.8619,以及图像调节转向的 0.8727。对于 CheXOne-3B,肺炎文本转向将校准的 F1 从 0.8528 增加到 0.8666,尽管置信区间跨越零。在这个公共肺炎基准上,CAA 在没有 微调 的情况下大幅改变了预测分数分布和操作特征。在三个评估的 VLM 之一中观察到了有意义的性能提升,这表明激活引导可以作为适应医疗 VLM 行为的轻量级方法。