论文

用于稳健多框架医疗 VQA 的目标对齐直接答案 SFT

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA

模型训练监督微调与指令调优

摘要

多帧医学 VQA 似乎奖励日益复杂的适应:控制器式推理、本地化感知重排序、静态硬负混合和分阶段延续从第一原理来看似乎都是合理的。我们在 MedFrameQA 上测试了一个更简单的竞争假设:一旦通过固定分割、匹配预算、重复种子和校准来控制评估,与基准最终答案目标保持紧密一致的方法应该是最强的 \emph{robust} 适应系列。我们比较了基于控制器的方法、脚手架进化、静态混合监督、连续重变量和直接仅答案监督 微调 (SFT)。最强大的稳健系列是 MedGemma-1.5-4B 上的直接解码器答案 SFT。根据经验,该家族在保留报告准确性方面比冻结基线有了显着提高,同时在重复种子和匹配对照中保持显着稳定,确保我们的主张反映了真正的家族级别的稳健性,而不是孤立的超参数峰值。此外,事后校准有效地修复了置信度估计,而不会影响准确性,并且核心方法一致地转移到 Qwen2.5-VL-3B 等二级骨干网。因此,主要结果不是复杂的辅助机制获胜,而是目标一致的直接答案 SFT 是我们为 MedFrameQA 找到的最强大的鲁棒适应家族。通过建立这个强大的、简约的基线,我们希望将社区的注意力转向从根本上稳健的优化,而不是架构复杂性。