论文
医疗VLM后训练审计:准确率变化未必来自视觉利用
From Reward Signal to Visual Utility: A Controlled Audit of Medical VLM Post-Training
摘要
医学视觉语言模型 (VLM) 训练后通常通过答案准确性进行评估。我们在 PMC-VQA 的受控 Qwen2.5-VL-3B 研究中研究了准确性和训练目标的变化如何与图像条件决策相关。我们将监督微调(SFT)与仅限于语言模型的低秩适应(LoRA)、扩展的多模态适应范围、仅标准答案的组相对策略优化(GRPO)和反事实证据目标进行比较。在 2,000 个干净测试问题上,语言模型 LoRA SFT 将正确图像准确性提高了 +1.10 个百分点(95% 配对bootstrap置信区间:-0.85 至 +3.05),而视觉效益事件减少了 2.40 个百分点,图像敏感度降低了 5.60 个百分点。配对记录显示 155 个获得的视觉益处事件和 203 个失去的视觉益处事件。与语言模型 LoRA SFT 相比,更广泛的适应产生的正确图像精度较低。标准 GRPO 产生混合奖励组和参数更新,并具有不确定的干净测试精度变化。生成审计表明,规范选项分数可以遵循与生成答案不同的标记路径。通过沿着贪婪生成路径获取分数,证据目标在训练集上得到改进;它相对于标准 GRPO 的增益在匹配训练剂量的验证数据上仍然不一致。样本级分析追踪证据评分、决策裕度和生成的答案在训练后如何变化。这种实证和测量审计确定了优化活动、目标获取和有用的留出数据上的视觉行为之间的差距。
